Skip to content

Latest commit

 

History

History
249 lines (193 loc) · 26.2 KB

File metadata and controls

249 lines (193 loc) · 26.2 KB

头脑风暴机制摘要:本地课堂助手 — 功能完善与性能提升方向(v0.4.0 之后)

状态: 前瞻研究(2026-08,v0.4.0 规划完成后产出) 用途: 本文档是机制摘要——面向其他 AI 模型的头脑风暴输入。阅读者无需访问本仓库,凭本文档即可理解系统现状、已排期机制与待挖掘空间,并产出新的机制候选。 关联: v0.4.0 规划 · 需求池 · 上一轮头脑风暴:无云端 AI 的视频内容提取极限 · 技术债清单


0. 给其他 AI 模型的使用说明(头脑风暴任务书)

  • 任务:阅读 §1(系统现状)→ §2(外部研究)→ §3(机制候选清单),然后:
    1. 提出未被 §3 列出的新机制(功能完善 / 性能提升 / 准确性 / 可靠性 / 架构);
    2. 或对 §3 中已列机制给出更优实现路径 / 更小成本的替代方案;
    3. 或指出 §3 中与现有机制冲突、冗余、或违反约束的条目并说明理由。
  • 硬约束(铁律):本地优先——数据不出本机,所有云端能力必须有本地兜底路径;不引入需要在线下载才能编译的依赖(本机 TLS 拦截,UnknownIssuer);单文件 ≤300 行、纯逻辑与副作用分离、防御性编程(超时/重试/降级);Windows-only(Tauri 2 + Rust)。
  • 评分标准:可行性(1-5,依赖/前置条件/实现成本)× 影响力(1-5,用户可感知价值或资源收益)× 创新性(1-5,是否超越"再实现一遍现成方案")。注明前置 spike 与风险。
  • 产出格式建议:表格(编号 / 机制名 / 原理 / 为什么有效 / 成本 / 风险 / ROI / 建议时机:可并入 v0.4.0 / v0.5.0 / V1.0 / 远期)。
  • 禁止:重复提出 §1.5 已否决清单中的机制;提出违反本地优先铁律的方案。

1. 系统快照(机制地图)

1.1 产品与定位

  • 产品:熵减(Entropydecrease)——面向技能自学者(化妆/编程/乐理/绘画等自我提升领域)的视频知识提取与持久化桌面应用。
  • 核心场景:用户观看教学视频/网课/实操演示时,应用实时捕获系统音频 + 目标窗口画面,本地 ASR + 本地 OCR 提取文本,规则拼接为笔记初稿;支持视频文件导入第二入口(字幕优先:有字幕直出 100% 准确,无字幕 fallback ASR)。
  • MVP 对标:通义听悟/讯飞听见级别的视频知识提取与持久化,但全本地、无云依赖。
  • 进度:v0.1.0(文件导入 ASR/OCR/拼接/笔记)→ v0.2.0(实时捕获链路)→ v0.3.0(文件导入+字幕优先+融合异步化,代码已交付,真机验收待执行)→ v0.4.0 规划中(课堂助手本地模式完成 + 实时性/准确性/资源三维优化)。

1.2 架构与数据流

输入信号                      引擎池(模型常驻,FFI 隔离)           产物
[WASAPI 环回] ──► 音频块 ──► VAD ──► 流式 Zipformer ──┐
[DXGI/GDI] ────► 帧 ──► 变化检测 ──► 字幕区/全帧 OCR ─┤
[ffmpeg 导入] ──► 音轨+关键帧 ──► 分窗 ASR / 帧 OCR ──┤
                                                    ▼
                        融合(纯规则:字幕权威+ASR补缝)──► SQLite 三表
                        SenseVoice 重打分(一致性校验)     (sessions/segments/
                        事件流 partial/final/字幕/OCR/状态   ocr_blocks)
                        ──► React 前端(实时面板/详情/笔记)
                        ──► V1.0 可选:云端 Qwen-VL 增强(默认关,离线降级本地拼接)
  • 引擎池(engine.rs):ASR/OCR 双 worker 线程,模型只加载一次,规避 FFI Send/Sync;请求经 mpsc channel 同步等待。
  • 双速率调度(ADR-002/005):字幕区 1-2fps、全帧 0.2-0.5fps;变化检测(分块 hash)过滤无变化帧。
  • 字幕 OCR 投票(subtitle_ocr.rs):同组样本字符多数投票纠错;编辑距离比例阈值判组;滚动字幕雏形过滤。
  • 融合(fusion.rs,纯规则):字幕段权威 → ASR 补缝(gap>1s)→ 重叠校对(编辑距离 ≤2 字幕胜出);停止后后台融合(REQ-031),无字幕短路。
  • 流式 ASR(streaming_asr.rs):partial 节流推送(≥150ms)→ 端点断句 final → 重建流(支持热词)→ SenseVoice 整句重打分(懒加载)。
  • 会话数据:sessions / session_segments / session_ocr_blocks 三表;时间戳统一会话纪元;句起时间戳 = Final 后首个非静音块。
  • 模型:SenseVoice int8(离线)+ streaming-zipformer fp16(流式,~650MB)+ Silero VAD + oar-ocr(PP-OCRv6,ONNX)+ ffmpeg(外部二进制)。

1.3 已实现机制清单(v0.1.0–v0.3.0,勿重复提出)

域 已实现机制
采集 WASAPI 环回(SubFormat 防御、墙钟时间戳、指数退避重连);DXGI Desktop Duplication + GDI 降级(远程/锁屏);窗口裁剪 + DPI;关闭保护;周期重建自愈
ASR 流式 Zipformer(partial 节流/端点断句/静音隔块喂入/尾句 flush 去重)+ SenseVoice 重打分 + hotwords 注入(空热词防崩溃)
OCR 底部 1/4 字幕区裁剪 + 全帧兜底;双速率采样;变化检测漏斗;多帧投票纠错;滚动字幕过滤雏形;960px 输入缩小;内存图像识别(免磁盘)
融合 纯规则四规则融合;停止异步化 + 无字幕短路;会话纪元统一时间戳;句起/句尾校正
存储 SQLite 三表 + 批量原子事务;会话 CRUD/检索(FTS5 基础);崩溃 failed 状态;50MB 字幕上限
前端 实时活动面板(最近 6 条转写/4 条画面要点);停止过渡态超时兜底;事件携带后端时间戳

1.4 已排期机制(v0.4.0 M0–M6,勿重复提出)

里程碑 机制
M0 v0.3.0 收尾:真机验收、TD-033(窗口跨显示器重建)
M1 OCR GPU 卸载:DirectML EP + 三层检测(DXGI 硬件门槛/ORT 原生回退/微基准校准)+ 回退链 + 状态 UI
M2 动态字幕区域:det 驱动 ROI 锁定 + 周期重扫 + 底部先验
M3 实时字幕体验:partial 先行上屏(灰→黑静默替换)+ hash 去重短路
M4 采样预算制(字幕区 ≤2fps / 全帧 ≤0.5fps)+ 高负载/电池降级 + VAD 采样旋钮
M5 热词/替换词表 CRUD + ASR hotwords 注入 + OCR 替换纠错 + OCR 高频词一键入热词

v0.4.0 明确不做:闪卡(REQ-019/020);时间轴回放与可编辑(REQ-023,V1.0);AI 问答与云端精修(REQ-024/025,V1.0);零拷贝(已裁决无收益);ASR GPU(预留 DeviceConfig 扩展位)。

1.5 已否决 / 搁置清单(勿重复提出,除非有新的突破性依据)

项 否决/搁置理由
mpv IPC 信号源 已决策不做(用户覆盖面窄、ROI 低,2026-08-18)
信号源插件抽象 无第一实例,随 mpv 否决搁置
剪贴板捕获(白名单) 隐私设计未决(涉安全红线),须 ADR + 授权交互后方可重启
浏览器扩展(B站/YouTube CC 直取) 交付物形态变重(签名/更新渠道),远期
说话人嵌入(完整 diarization) 本地质量待验证(可考虑降级为"说话人变化检测",见 A3)
跨会话去重(embedding 相似度合并) 搁置(无本地 embedding 选型)
实时增量融合 语义不成立(字幕 end_ms 靠下一字幕补齐、gap 判断需字幕全集)
静音降频 与笔记目标相悖,已裁决不做(v0.4.0 M4 只做"静音期全帧提频")
零拷贝帧传递 当前负载下无收益

2. 核心研究结论(外部依据)

2.1 流式 ASR 前沿(sherpa-onnx 生态)

  • 热词/上下文偏置(contextual biasing)是流式识别准确率的主流提升手段,本项目 M5 已排期;更深一层是"上下文无关的自举语言模型"(会话内 n-gram 统计重排,见 B1)。
  • 两遍解码(two-pass):流式粗识别 + 离线模型精修,本项目已有 SenseVoice 重打分雏形;完整版是"会话结束全量两遍解码"(D2)。
  • sherpa-onnx 提供 speaker embedding / 说话人变化检测(SCD)ONNX 模型,可在 VAD 间隙做音色相似度比对 → 轻量"谁在讲"标记(A3 前置 spike 即可验证质量)。
  • forced alignment(强制对齐) 可产出词级时间戳,用于精确句边界(替代 end_ms 近似)、关键词时间轴、融合 gap 判断(B8)。

2.2 音频前端(环回捕获之后、ASR 之前)

  • RNNoise:10ms 帧、~3ms 延迟、单核 ~3-5% CPU,广泛用于键盘/风扇/环境噪声抑制,常兼作 VAD 信号。注意:环回捕获的是"成品音频"(播放器已混好),降噪收益需实测校准——应做成可开关 + 微基准对比(A1)。
  • AGC(自动增益)对音量忽大忽小的课程(多人发言、远近麦克风差异)有实测收益;直流偏置/削波检测为廉价防御。

2.3 屏幕捕获(Windows)

  • DXGI Desktop Duplication 是本地会话性能最优路径(OBS 主力),但远程桌面/锁屏不可用(本项目已 GDI 降级);Windows.Graphics.Capture(WGC) 更稳健(含远程桌面),但 WinRT 异步模型与 Rust 线程集成成本高、帧回调性能略逊——作为长期演进方向保留,不构成当前替换理由。
  • 帧元数据(DXGI_OUTDUPL_FRAME_INFO.AccumulatedFrames)可做"未变化帧跳过"的零成本二次判断(E7)。
  • 关键帧思路(OBS 式):只在变化矩形内拷贝/检测,可进一步降低采集 CPU(当前为全帧 BGRA 转换 + 分块 hash)。

2.4 OCR 与 ONNX Runtime 性能

  • DirectML 不挑显卡(本项目 M1 正做);量化(int8/fp16)与输入缩小(近似平方级降延迟,本项目已做 960px)是确定性收益项。
  • ORT 运行时存在多个零成本调优点:intra-op 线程数、enable_cpu_mem_arena、图优化级别(默认可能非 ENABLE_ALL)、线程亲和性——需核对 oar-ocr/sherpa crate 是否暴露 SessionOptions(oar-ocr 0.9.1 已确认暴露 ort_session 配置,M1 已用)(E2)。
  • 版面分析/表格/公式识别(PaddleOCR 系)是板书/幻灯片结构化的现成路径(B4);公式可 LaTeX 化(纯规则渲染)。

2.5 可靠性方向

  • 崩溃恢复的行业基线:段级落库 + 幂等续传(本项目已有 failed 状态与批量事务);导入任务应可断点续跑(F1)。
  • 资源健康监测(磁盘/模型完整性/引擎存活)→ 状态徽标,是长会话产品的必备项(F2)。

3. 机制候选清单(头脑风暴产出)

编号规则:A=信号源与输入前端 / B=提取与识别质量 / C=内容组织与产物形态 / D=反馈闭环与学习回路 / E=性能与资源 / F=可靠性与韧性 / G=架构与可扩展性。 时机标注:[v0.4] = 可低成本并入 v0.4.0;[v0.5] = v0.4.0 之后下一个版本;[V1.0] = 已排 V1.0 或需前置;[远期]。

A. 信号源与输入前端(功能完善)

# 机制 原理 为什么有效 成本 风险 时机
A1 音频预处理链(可选):RNNoise 降噪 + AGC 自动增益 + 削波检测 采集后、VAD 前插入 DSP 纯函数;可开关 键盘/风扇/环境噪声是 ASR 主要错误源;音量差异破坏 VAD 阈值 低(RNNoise ~1MB 模型 + 纯函数封装;需微基准) 环回是成品音频,降噪可能损伤音质——必须实测校准 + 默认关 [v0.4]
A2 声道策略:立体声环回能量选优/合并 采集后按 RMS 选能量高的声道 单声道混入杂音时另一声道更干净;零模型成本 极低 声道语义因播放器而异,需实测 [v0.4]
A3 说话人变化检测(SCD 弱化版 diarization):sherpa-onnx speaker 模型在 VAD 间隙对比音色向量 → "讲者切换"事件 转写段标注讲者,多讲者课堂可读性大增;为会议类档案(V1)铺路 中(新模型 + 特征提取;前置 spike 验证质量) 完整 diarization 质量不佳,但"变化检测"弱化版(不聚类身份,只标记切换)成功率显著更高 [v0.5]
A4 课件预热(课前导入):课前导入 PPT/PDF → 本地文本提取 → 自动生成热词/替换词预热 + 章节先验 把学习内容前置到"课前 5 分钟",实时链路零成本受益 中(PPT/PDF 解析 + 词表预热管线) PDF 解析(文本/图像混合)质量不一 [v0.5]
A5 窗口标题/元数据信号:捕获目标窗口标题 → 章节语义暗示("PPT-第3章"/IDE 文件名) 零成本辅助信号,可进章节检测投票(C1) 极低 标题噪声大,需白名单规则 [v0.4]

B. 提取与识别质量

# 机制 原理 为什么有效 成本 风险 时机
B1 会话自举 n-gram 语言模型校正:会话内已确认文本构建统计 LM → 对后续 OCR/ASR 结果做候选重排 专业术语在会话内反复出现,自举比外部语料更贴合 中(统计 LM 纯 Rust 可做) 冷启动期样本不足;与热词机制(M5)部分重叠,需区分定位(热词=词级加权,LM=句级重排) [v0.5]
B2 跨信道交叉验证(RAID 思路):ASR / 字幕 OCR / 字幕文件三源按时间轴对齐互校 冗余信道互相纠错,超出 ADR-005 的编辑距离 ≤2 浅层版本 中(对齐 + 投票纯函数;需 ADR-006 派生视图配合才不污染原始段) 三源时间戳对齐复杂 [V1.0]
B3 置信度落库 + 低置信标记:OCR block score / ASR 置信度 → 段级 confidence → "需人工校对"视图 把"提取物定位"从成品笔记改为可校对学习原料(O1),用户信任度提升 中(模型是否暴露置信度需 spike) oar-ocr 只有 score 无置信度时退化为启发式 [v0.5]
B4 板书/幻灯片结构化:版面分析 + 表格/公式/代码块识别(PaddleOCR 系模型) 实操/课件课的核心信息在画面不在语音;公式 LaTeX 化、代码块结构化存储 中高(新模型 + 结构化 schema) 模型体积与准确率权衡 [V1.0]
B5 口语书面化(本地规则版):语气词过滤、重复整理、标点恢复(纯规则+统计,无 LLM) 转写产物从"语音流"变"可读文本",笔记质量直观提升 中(规则工程,需语料校准) 过激改写损伤原意——必须可逆(保留原文段) [v0.5]
B6 关键帧图集 / 步骤卡:感知哈希聚类相似帧 → 画面簇 = 一个操作步骤 = 簇首帧 + 时间范围 实操类视频(化妆/手工/软件操作)唯一有效形态(S4,上轮评估第 1 名) 中(聚类纯函数 + 前端画廊 UI) 独立前端工作量;簇边界质量需 spike [v0.5]
B7 滚动字幕/弹幕强过滤:长公共子串检测 + 滚动方向判定 歌词/弹幕污染字幕权威源 低(纯函数增强) 误杀正常切换字幕(阈值需校准) [v0.4]
B8 词级时间戳(forced alignment):离线对齐产出词级时间戳 精确句边界(替代近似)、关键词时间轴、融合 gap 判断、未来"点击词跳转" 中(离线路径跑对齐;sherpa-onnx 已支持) 流式路径无对齐(仅离线/课后精修路径可用) [v0.5]

C. 内容组织与产物形态

# 机制 原理 为什么有效 成本 风险 时机
C1 三信号章节检测:画面切换(已有)+ 长静音(已有)+ n-gram 话题重合度下降,三票同刻 → 章节边界 长视频结构化刚需(S1);全部信号已存在,纯规则融合 低中 阈值调参需样本 [v0.5]
C2 重点候选标注:重复短语 ≥2 次 / 音量语速骤变(DSP)/ OCR 文本持续停留 N 帧 → 重点标记 笔记初稿直接带重点(S2),学习回路(D3)前置 中(DSP 特征 + 规则) 误标率需用户反馈校准(接 D1) [v0.5]
C3 术语表自动构建:OCR 高频词 × ASR 低频词交叉 → 候选术语 → 用户确认 → 反哺 hotwords + 笔记词汇表 M5 只做"一键加入",本机制做自动发现(S3),闭环更完整 中 候选质量需确认 UI 把关 [v0.5]
C4 大纲视图生成(纯规则):OCR 大字块/固定位置标题检测 + 幻灯片标题提取 → 课程大纲 规则可做的"章节速览"(REQ-026 前置),零 LLM 低中 标题检测误判需阈值校准 [v0.5]
C5 会话检索 + 时间回跳:FTS5 已有基础,补"搜索结果 → 点击跳转视频时刻" 知识回找的核心体验(O3/REQ-023 前置) 中(依赖 C6 或实时录制) 无录制则只能跳转"转录时刻"无画面 [V1.0]
C6 会话视频录制(可选):采集中可选录制低帧率视频(H.264 或关键帧序列)+ 时间戳对齐存储 回放/回跳/步骤卡的地基;实时链路已有帧流,增量成本 中高(编码器 + 磁盘管理) 磁盘占用;隐私(用户自选开启) [V1.0]
C7 导出体系:SRT/VTT 字幕导出、Markdown 笔记导出、带时间戳引用格式 学习产物可携带(进 Anki/其他工具),生态价值 低 — [v0.5]
C8 跨会话合并去重:n-gram 相似度聚类 → 课程级知识体 多遍观看同一课程时合并(O5) 中高 无本地 embedding 选型(上轮搁置) [远期]

D. 反馈闭环与学习回路

# 机制 原理 为什么有效 成本 风险 时机
D1 用户确认回路:校对编辑 → 反哺规则参数(去重窗/编辑距离阈值/hotwords 权重/替换词) 无 LLM 的"学习"(O2);用户编辑是最廉价的高质量标注 中(UX + 参数化改造) 参数自动调整需"可回滚 + 透明展示",防失控 [v0.5]
D2 会话结束离线精修:实时粗稿 + 后台两遍解码 + 全量融合 + 多帧投票 + 词级对齐 → 离线级产物 实时体验与离线质量兼得(O4);M3 的静默修正从"句级"升"会话级" 中(后台任务 + 派生视图前置) 与 ADR-006(REQ-032)强耦合 [V1.0]
D3 重点标记 → 闪卡联动:C2 重点 → 一键生成闪卡(REQ-027);闪卡本体(REQ-019/020)顺延后跟进 从"提取"到"记住"的闭环,竞品无此链路 中(闪卡顺延后重排期) 依赖 C2 质量 [V1.0]
D4 学习统计:会话时长/语音占比/停顿频率/OCR 要点数 → 学习报告 轻量差异化,成本低 低 指标定义需产品确认 [v0.5]

E. 性能与资源

# 机制 原理 为什么有效 成本 风险 时机
E1 ORT 运行时调优:intra-op 线程数 / CPU memory arena / 图优化级别 / 线程亲和性 零成本确定性收益;M1 已确认 oar-ocr 暴露 SessionOptions,sherpa 侧需核对 低(配置项 + 基准对比) 线程数配置不当反伤实时性(需基准) [v0.4]
E2 ASR 模型档位:设备能力检测(核数/内存/AVX)→ 选择 int8/小模型/关闭重打分 低配机可用性;与 M1 的 DeviceConfig 扩展位合并 中(模型分发复杂度上升) 多档位 = 多模型体积/测试面 [v0.5]
E3 启动加速:模型 mmap/预加载 + 首会话前后台预热 + WebView 懒加载 "双击到能录"秒级体验;引擎池已常驻,补预热窗口 低中 预热与用户手动启停的时序竞态 [v0.4]
E4 内存有界:会话窗口滑出即弃内存(落库即弃);SenseVoice 重打分引擎按需加载/卸载 长会话内存稳定(ADR-003 遗留评估项) 低 重打分卸载策略影响修正延迟 [v0.5]
E5 OCR 结果缓存(LRU):区域感知哈希 → 结果缓存;A→B→A 帧变化不重复识别 变化检测只过滤"无变化",本机制过滤"变回去了";PPT 翻页往返典型场景 低(纯增量) 缓存键设计(区域+缩略哈希)需防碰撞 [v0.4]
E6 电量感知降级:电池模式 → 采样降档 + 禁 GPU OCR M4 已有负载降级,补电源维度(P8 扩展) 低 Windows 电源事件 API 细节 [v0.5]
E7 采集链路零分配:staging 纹理复用、BGRA→RGB 内联、DXGI AccumulatedFrames 跳过判断 采集 CPU 占比下降(当前为开销排序第 3 位) 低中 零拷贝已否决,本项是"低分配"不越界 [v0.5]
E8 前端渲染性能:时间轴/转写流虚拟列表、详情页分页查询、事件合并 长会话(数千段)UI 卡顿预防 中 — [v0.5]
E9 视频类型档案(VideoProfile):按内容类型(实操/代码/会议/PPT)预设采样策略与产物形态 管线配置化(V1 全面版):一次调优多处受益;v0.4.0 已显式化"字幕/无字幕"二态 中 档案数量与维护成本权衡 [v0.5]

F. 可靠性与韧性

# 机制 原理 为什么有效 成本 风险 时机
F1 导入任务断点续跑:分段转写进度持久化 + 中断恢复 大视频导入(30 分钟+)中断不重来 中(进度状态机 + 恢复路径) 与现有导入管线耦合 [v0.5]
F2 资源健康监测:磁盘空间 / 模型完整性 / 引擎存活巡检 → 状态徽标 长会话产品的必备项;磁盘写满崩溃是最常见隐性故障 低 — [v0.4]
F3 静默失败可见化:OCR/ASR 失败计数 → 会话摘要提示 TD-001 已做笔记侧警告段落,扩展到会话详情 低 — [v0.4]
F4 崩溃恢复增强:崩溃后"恢复会话"提示 + 续传(段级落库已有) 长时间课堂崩溃不丢已提取内容 中 恢复 UI 与现有会话列表集成 [v0.5]

G. 架构与可扩展性

# 机制 原理 为什么有效 成本 风险 时机
G1 会话派生视图(原始段与融合轴分离 + fused_at) B2/D2 的地基;支持重算融合/可信度审计(REQ-032/ADR-006 已立项) 中高(数据模型变更,涉 ADR-004/005) 迁移兼容 [V1.0]
G2 本地诊断面板:帧率/延迟/CPU 曲线/预算命中率(开发期可隐藏) 优化决策的数据基础(P 系列机制全部依赖实测);当前开销排序是代码推断非实测 中(指标埋点 + 面板) 埋点性能开销需自控 [v0.4]
G3 性能基准护栏(CI):合成音频/合成帧 golden 测试 + 延迟/CPU 基准回归门禁 防止优化回退(本项目测试文化强,缺口在性能维度) 中 基准机器差异需归一化 [v0.5]
G4 模型按需分发:只下载设备所需档位(int8/完整/DML 包),增量校验 安装/首启体验(当前流式模型 650MB 全量) 中 分发矩阵复杂化 [v0.5]

4. 快速评估(ROI 排序,供排期参考)

排名 机制 可行性 影响力 创新性 时机建议 一句话理由
1 E1 ORT 运行时调优 5 4 2 [v0.4] 零成本确定性收益,立即做
2 E5 OCR 结果缓存 5 3 3 [v0.4] 小增量,PPT 往返场景显著
3 A1 音频预处理链(可开关) 4 4 3 [v0.4] 课堂环境噪声是 CER 主要来源,需实测校准
4 G2 本地诊断面板 4 4 3 [v0.4] 一切优化决策的数据前提
5 A5 窗口标题信号 5 2 3 [v0.4] 零成本辅助信号
6 B7 滚动字幕强过滤 4 3 2 [v0.4] 纯函数增强
7 F2/F3 健康监测与失败可见化 4 3 2 [v0.4] 长会话可靠性基线
8 C1 三信号章节检测 4 4 3 [v0.5] 结构化刚需,信号全现成
9 B6 关键帧图集/步骤卡 4 5 4 [v0.5] 实操类唯一有效形态(上轮第 1 名)
10 A3 说话人变化检测 3 4 4 [v0.5] 多讲者课堂可读性,spike 决定去留
11 B3 置信度落库 3 4 3 [v0.5] "可校对原料"定位的产品基石
12 B5 口语书面化(本地版) 4 4 2 [v0.5] 笔记可读性直观提升
13 C3 术语表自动构建 4 3 3 [v0.5] M5 闭环的自然延伸
14 D1 用户确认回路 3 4 4 [v0.5] 无 LLM 的自我进化
15 B8 词级时间戳 3 4 3 [v0.5] 精确对齐的地基

5. 开放问题(需 spike / 实测验证)

  • 环回音频降噪是否有净收益(A1):环回已是成品音频,RNNoise 可能损伤音质——需微基准(降噪开/关对比 CER)后决定默认值
  • sherpa-onnx SCD 模型在流式链路的可用性与质量(A3):spike 决定做"变化检测弱化版"还是搁置
  • oar-ocr / sherpa crate 的 ORT SessionOptions 暴露面(E1):线程数/图优化级别可配置性核对
  • 置信度字段可用性(B3):oar-ocr block score 与 sherpa 置信度是否能到段级
  • 开销实测校准:ASR/OCR/采集的 CPU 占比目前是代码推断(2026-08-18),G2 落地后更新
  • 词级对齐在流式路径的替代方案(B8):无对齐时是否用"重打分整句 + 句内等分"近似
  • PPT/PDF 预热解析质量(A4):文本提取 vs 图像化页面的降级路径

6. 回顾与边界

  • 本摘要的机制清单是v0.4.0 规划之外的增量空间;v0.4.0 内已有 M0–M6 的机制(§1.4)不应重复提出,但可与新机制组合(如 B3 依赖 M1 的 device status、C3 依赖 M5 的热词基础设施)。
  • 全部机制遵循本地优先铁律:任何"云端可选"方案必须带本地兜底(当前唯一云端项是 V1.0 的 Qwen-VL 可选增强,默认关闭)。
  • 性能类机制的共同前提是先测量后优化(G2 诊断面板优先于一切 P 系列机制)。