状态: 活跃维护(v0.7.2 更新:采集信息面板 / 合集检测 / 说话人分离 / 断句自适应) 定位: 技能自学视频的本地知识提取入口——屏幕+音频捕获(实时)或视频文件导入(离线),全部本地处理,数据不出本机。
| 入口 | 适用 | 说明 |
|---|---|---|
| 实时捕获 | 正在观看的网课/教程(B站、YouTube、本地播放器等) | 系统声音 + 屏幕字幕 + 流式转写(Zipformer)边看边记:右侧实时显示转写与画面图片;停止后到「会话」页查看时间轴并可一键转笔记 |
| 文件导入 | 已下载的视频文件 | 有字幕文件/内嵌字幕优先(免转写),否则本地 ASR 转写 |
- 准备:引擎就绪清单全绿(流式 ASR / SenseVoice / OCR 设备 / 结构模型 / 磁盘)
- 选窗口:选择要采集的视频窗口;自动检测视频类型档案(13 类,可改)与合集信息
- 开始采集(三条通道并行,全部本地):
- 系统声音 → 本地流式转写(Zipformer 边说边出 + SenseVoice 静默修正)
- 屏幕字幕 → 检测画面内嵌/滚动字幕(有字幕优先信道)
- 画面图片 → 关键帧实时归档(「最近画面」条 + 画面要点 OCR)
- 边看边记:右侧实时显示转写(识别中灰斜体按句分行 + 定稿行)与画面图片;信息条同步显示平台/时长/合集集号/字幕状态
- 停止后:自动融合(字幕 + 语音 + 画面)生成会话 → 到「会话」页查看时间轴(转写/画面/大纲/质量报告/图集),可一键转笔记
- 「引擎就绪清单」全绿即可开始(流式 ASR / SenseVoice / OCR 设备 / 结构模型 / 磁盘)
- 首次使用需下载流式 ASR 模型(应用内一键下载);说话人模型为可选增强(见第五节)
采集过程中,实时转写面板上方显示当前视频的信息条(全部本地识别):
| 信息 | 来源 | 说明 |
|---|---|---|
| 🎬 平台 | 窗口标题后缀 | 哔哩哔哩 / YouTube / 腾讯视频 / 爱奇艺 / 优酷 / 芒果TV / 西瓜视频 / 抖音;本地窗口不显示 |
| ⏱ 时长 | 播放器画面 OCR | 识别播放器时间文本(12:34 / 1:23:45);约 10s 内出现,识别失败不显示 |
| 📚 合集 | 标题规则 + 播放器 OCR | 显示系列名与集号(零基础化妆教程 第3集 / 共12集);标题带 P/第X集/EP 或播放器分P文本均可识别 |
| 💬 字幕 | 实时字幕检测 | 「检测到(内嵌/滚动)」或「未检测到」 |
限制:时长/集号识别自播放器画面文字——播放器样式特殊时可能识别不到(如实不显示,不影响采集);外部字幕文件只在文件导入路径生效(实时捕获无外部字幕概念)。
- 选定窗口后自动检测档案(网课/实操/口播/访谈/会议/播客/直播/白板/游戏教程/题目讲解/跟练/编程实战/未知)
- 无法自动识别时如实选中「未知」(参数走默认档,不假装猜中)
- 合集联动(v0.7.2):同一系列的 P1/P2/P3 标题会被识别为同一系列——档案检测跨集一致,且你确认过一次档案后,整个系列后续各集自动生效(记忆按系列名存储)
- 低置信/信号冲突时请手动确认一次,你的选择会记住
适用前提(实时捕获流程):系统声音 + 屏幕字幕 + 流式转写(Zipformer)边看边记——右侧实时显示转写与画面图片;停止后到「会话」页查看时间轴并可一键转笔记。说话人分离的讲者切换标记就展示在实时捕获生成的会话详情页(访谈/会议档案)。
访谈、会议等多人视频的讲者切换标记——只标注"这里换人了",不识别身份。
- 启用方式(可选增强):运行
app/scripts/download-speaker-model.ps1下载模型(wespeaker 中文模型 wespeaker_zh_cnceleb_resnet34,约 26.5MB,Apache-2.0 许可),重启应用 - 使用场景:访谈/会议档案的会话详情页会显示「👥 讲者切换 N 处」及时间点(按置信度排序标注)
- 效果预期与局限(请务必了解):
- 本地方案效果有限:无云端说话人分离(如 pyannote 级服务)的精度——本地 wespeaker 音色向量 + 余弦阈值是"可用级"而非"准确级":
- 两人访谈:切换点检测约 85-90% 可用;多人会议约 75-80%
- 音色相近的说话人(同性别、相似嗓音)会漏判;环境音/回声干扰下可能误判(把一段语气变化当换人)
- 系统音频是混音(视频原声 + 环境噪声),非干净单麦录音——分离质量天然低于专业录制场景
- 短句(<0.5s)与静音段不计入分析(音色向量不稳,宁漏勿错)
- 弱化版只标切换点,不聚类身份(不会显示"讲者 A/B"归属)——身份聚类为后续版本
- 模型未下载时功能自动隐藏降级(显示提示,不影响任何其他功能)
- 单人讲课通常检测不到切换(属正常,非故障)
- 建议:把讲者切换标记当作"此处可能换人"的线索使用,涉及关键信息归属时对照原视频确认
- 本地方案效果有限:无云端说话人分离(如 pyannote 级服务)的精度——本地 wespeaker 音色向量 + 余弦阈值是"可用级"而非"准确级":
- 分析在会话详情打开时自动执行(幂等:只分析一次,结果落库)
系统会统计当前说话人的语速与停顿习惯自动调节断句合并阈值:
- 机关枪式不停顿讲课 → 收紧合并(段落粒度更稳,避免整段挂起)
- 慢速、长停顿讲课 → 放宽合并(句子不被切碎)
- 语速骤降(讲慢 = 强调)会记录为信号事件,供后续重点标注消费
| 问题 | 说明 |
|---|---|
| 转写只有一行灰色斜体 | 正常——识别中的内容按句读分行显示,定稿后进入转写列表 |
| 「最近画面」不显示 | 等待画面变化(板书/PPT 翻页自动截取)或按 Ctrl+Shift+S 手动截图 |
| 档案检测总让我确认 | 信号不足/冲突时的诚实行为——确认一次后同系列自动记住 |
| 讲者切换显示"未启用" | 未下载说话人模型(见第五节),不影响其他功能 |
- 全部本地处理:音频、画面、转写、笔记不出本机(AI 增强功能默认关闭,需授权)
- 剪贴板信号只存 30 字预览(隐私红线)
- 会话音频保留 30 天 + 磁盘预算自动清理(可在设置查看)