Skip to content

Latest commit

 

History

History
90 lines (66 loc) · 6.74 KB

File metadata and controls

90 lines (66 loc) · 6.74 KB

课堂助手使用说明

状态: 活跃维护(v0.7.2 更新:采集信息面板 / 合集检测 / 说话人分离 / 断句自适应) 定位: 技能自学视频的本地知识提取入口——屏幕+音频捕获(实时)或视频文件导入(离线),全部本地处理,数据不出本机。

一、两条使用入口

入口 适用 说明
实时捕获 正在观看的网课/教程(B站、YouTube、本地播放器等) 系统声音 + 屏幕字幕 + 流式转写(Zipformer)边看边记:右侧实时显示转写与画面图片;停止后到「会话」页查看时间轴并可一键转笔记
文件导入 已下载的视频文件 有字幕文件/内嵌字幕优先(免转写),否则本地 ASR 转写

实时捕获完整流程

  1. 准备:引擎就绪清单全绿(流式 ASR / SenseVoice / OCR 设备 / 结构模型 / 磁盘)
  2. 选窗口:选择要采集的视频窗口;自动检测视频类型档案(13 类,可改)与合集信息
  3. 开始采集(三条通道并行,全部本地):
    • 系统声音 → 本地流式转写(Zipformer 边说边出 + SenseVoice 静默修正)
    • 屏幕字幕 → 检测画面内嵌/滚动字幕(有字幕优先信道)
    • 画面图片 → 关键帧实时归档(「最近画面」条 + 画面要点 OCR)
  4. 边看边记:右侧实时显示转写(识别中灰斜体按句分行 + 定稿行)与画面图片;信息条同步显示平台/时长/合集集号/字幕状态
  5. 停止后:自动融合(字幕 + 语音 + 画面)生成会话 → 到「会话」页查看时间轴(转写/画面/大纲/质量报告/图集),可一键转笔记

二、采集前准备

  • 「引擎就绪清单」全绿即可开始(流式 ASR / SenseVoice / OCR 设备 / 结构模型 / 磁盘)
  • 首次使用需下载流式 ASR 模型(应用内一键下载);说话人模型为可选增强(见第五节)

三、采集信息面板(v0.7.2 新增)

采集过程中,实时转写面板上方显示当前视频的信息条(全部本地识别):

信息 来源 说明
🎬 平台 窗口标题后缀 哔哩哔哩 / YouTube / 腾讯视频 / 爱奇艺 / 优酷 / 芒果TV / 西瓜视频 / 抖音;本地窗口不显示
⏱ 时长 播放器画面 OCR 识别播放器时间文本(12:34 / 1:23:45);约 10s 内出现,识别失败不显示
📚 合集 标题规则 + 播放器 OCR 显示系列名与集号(零基础化妆教程 第3集 / 共12集);标题带 P/第X集/EP 或播放器分P文本均可识别
💬 字幕 实时字幕检测 「检测到(内嵌/滚动)」或「未检测到」

限制:时长/集号识别自播放器画面文字——播放器样式特殊时可能识别不到(如实不显示,不影响采集);外部字幕文件只在文件导入路径生效(实时捕获无外部字幕概念)。

四、视频类型档案(13 类 + 合集联动)

  • 选定窗口后自动检测档案(网课/实操/口播/访谈/会议/播客/直播/白板/游戏教程/题目讲解/跟练/编程实战/未知)
  • 无法自动识别时如实选中「未知」(参数走默认档,不假装猜中)
  • 合集联动(v0.7.2):同一系列的 P1/P2/P3 标题会被识别为同一系列——档案检测跨集一致,且你确认过一次档案后,整个系列后续各集自动生效(记忆按系列名存储)
  • 低置信/信号冲突时请手动确认一次,你的选择会记住

五、说话人分离(弱化版,v0.7.2 新增)

适用前提(实时捕获流程):系统声音 + 屏幕字幕 + 流式转写(Zipformer)边看边记——右侧实时显示转写与画面图片;停止后到「会话」页查看时间轴并可一键转笔记。说话人分离的讲者切换标记就展示在实时捕获生成的会话详情页(访谈/会议档案)。

访谈、会议等多人视频的讲者切换标记——只标注"这里换人了",不识别身份。

  • 启用方式(可选增强):运行 app/scripts/download-speaker-model.ps1 下载模型(wespeaker 中文模型 wespeaker_zh_cnceleb_resnet34,约 26.5MB,Apache-2.0 许可),重启应用
  • 使用场景:访谈/会议档案的会话详情页会显示「👥 讲者切换 N 处」及时间点(按置信度排序标注)
  • 效果预期与局限(请务必了解):
    • 本地方案效果有限:无云端说话人分离(如 pyannote 级服务)的精度——本地 wespeaker 音色向量 + 余弦阈值是"可用级"而非"准确级":
      • 两人访谈:切换点检测约 85-90% 可用;多人会议约 75-80%
      • 音色相近的说话人(同性别、相似嗓音)会漏判;环境音/回声干扰下可能误判(把一段语气变化当换人)
      • 系统音频是混音(视频原声 + 环境噪声),非干净单麦录音——分离质量天然低于专业录制场景
      • 短句(<0.5s)与静音段不计入分析(音色向量不稳,宁漏勿错)
    • 弱化版只标切换点,不聚类身份(不会显示"讲者 A/B"归属)——身份聚类为后续版本
    • 模型未下载时功能自动隐藏降级(显示提示,不影响任何其他功能)
    • 单人讲课通常检测不到切换(属正常,非故障)
    • 建议:把讲者切换标记当作"此处可能换人"的线索使用,涉及关键信息归属时对照原视频确认
  • 分析在会话详情打开时自动执行(幂等:只分析一次,结果落库)

六、断句自适应(v0.7.2,无需操作)

系统会统计当前说话人的语速与停顿习惯自动调节断句合并阈值:

  • 机关枪式不停顿讲课 → 收紧合并(段落粒度更稳,避免整段挂起)
  • 慢速、长停顿讲课 → 放宽合并(句子不被切碎)
  • 语速骤降(讲慢 = 强调)会记录为信号事件,供后续重点标注消费

七、常见问题

问题 说明
转写只有一行灰色斜体 正常——识别中的内容按句读分行显示,定稿后进入转写列表
「最近画面」不显示 等待画面变化(板书/PPT 翻页自动截取)或按 Ctrl+Shift+S 手动截图
档案检测总让我确认 信号不足/冲突时的诚实行为——确认一次后同系列自动记住
讲者切换显示"未启用" 未下载说话人模型(见第五节),不影响其他功能

八、数据与隐私

  • 全部本地处理:音频、画面、转写、笔记不出本机(AI 增强功能默认关闭,需授权)
  • 剪贴板信号只存 30 字预览(隐私红线)
  • 会话音频保留 30 天 + 磁盘预算自动清理(可在设置查看)