状态: 前瞻调研(未排期,2026-08-20 六源合并) 用途: v0.8.0 AI 线之后批次的排期输入;与 需求池远期区段、机制摘要 配套使用 调研来源(6 类): ① 需求池 V1.0/V1.1+ 远期 REQ(24 条)② Foresight 四份前瞻(机制 42 项/档案检测 20 项/数据清单 30 项/提取极限 L1-L4)③ 版本文档"不做/缓做"清单(v0.5.0~v0.8.0)④ ADR-010(补缝 AI 规划)⑤ 技术债台账(open 7 笔 + 观察 8 条 + carried 4 笔)⑥ 模型接入与前端接线双盘点 + 影子层模块核验(8 个) 方法: 六源去重合并(已落地项标注 ✅)、依赖链标注、分层排序;全部结论可经文件:行号回溯
- "接线问题"多于"能力缺失":数据清单六层约 30 项绝大多数已闭环;未投入的是增强型数据(词级时间戳/讲者/图像流/元数据)——缺的是消费端排期;档案检测根因①同样是"参数存在但从未被填充"。
- 三条最高置信主线(四份前瞻文档互为印证):
- ① 已有信号接线 + 多信号投票(章节/档案/重点——信号全现成只差融合)
- ② 反馈闭环/用户纠错回流(用户编辑是最廉价的高质量标注)
- ③ VideoProfile 档案化(管线配置化骨架,"架构极限三件套"之一)
- 性能类优化的共同前提:先测量后优化——本地诊断面板(G2)优先于一切性能机制。
- 两个枢纽:REQ-056 补缝 AI(058/093/094 前置)、闪卡 REQ-019/020(021/022/027 前置)。
| # | 候选 | 来源 | 说明 |
|---|---|---|---|
| S1 | image_crop → structure_capture 接线 | 影子层核验 | structure_capture.rs 头部已规划"白边裁剪(image_crop 机制)"但管线未调用——本模块内接线缺口;纯函数已单测,存储/缩略图直接受益 |
| S2 | TD-E/F:health_status 增查 speaker/punctuation 模型 | 技术债 open | 就绪清单(ReadyCheckCard)补 2 项;标点缺失提示一并解决 |
| S3 | TD-I:live:window-lost 前端横幅 | 技术债 open | 目标窗口丢失用户无感知(采集中画面源不可见);与 asr-degraded 同模式 |
| S4 | TD-H:音频落盘状态/清理 UI 或修注释 | 技术债 open | 后端注释"承诺未兑现" |
| S5 | 观察 2:render_note_structure 无结构早退 | 技术债观察 | chapters/glossary 均空时直接返回(黄金测试保输出不变,零风险) |
| S6 | 卫生项:model_registry::list_versions 冗余清理 + asr_dedupe 过时豁免清理 | 影子层核验 | 同盘点清偿 S1 模式 |
| S7 | 观察 4:AGENTS.md VAD 表述修正(RMS+自适应,非 Silero) | 技术债观察 | 规范一致性(倾向改文档;补模型需产品决策) |
| # | 候选 | 来源 | 说明 |
|---|---|---|---|
| M1 | TD-A + 观察 1:三命令 spawn_blocking 合并改造 | 技术债 open+观察 | session_to_note/batch(≤50 条)/preview 三命令;先例 review_text_filter 可抄;数据移入闭包后 to_vec 变所有权转移,一次改动双收益;1-2 人日 |
| M2 | TD-D:说话人模型应用内下载 | 技术债 open | 按 structure_models 模式加下载命令+UI(对照流式/结构模型) |
| M3 | TD-G:备份/恢复 UI | 技术债 open | REQ-107 TRUST-1 能力不可达(后端已 spawn_blocking) |
| M4 | 档案检测批一:#4 增量再检测接线、#1 标题结构化、#2 负向规则、#3 归一化 | Foresight doc4 | 纯逻辑可单测、不动采集链路、低成本高收益 |
| M5 | 观察 3/5:titled_chapters 展示 + 课堂助手页捕获结果提示 | 技术债观察 | 各 S 级单点 |
| # | 候选 | 来源 | 前置/风险 |
|---|---|---|---|
| L1 | audio_route_probe 分应用音频路由 | 影子层 | spike 已过 API 面;接入=capture/audio_loopback 核心链路改造 + REQ-105 兜底;独立于 AI 线的最高价值影子能力(根治微信/广告声混入) |
| L2 | interruption_detect 抢话检测 | 影子层 | 代理版技术上可接(live_session_loop Final 处),但该文件属其他代理域 + 精度需真机圆桌样本——随 live_session 域排期 |
| L3 | dtw_align 时序对齐 | 影子层 | spike 门未过:等 M4 音频落盘后实测漂移分布,有收益才接入(当前不改变行为是正确姿态) |
| L4 | image_stream_store 图像流接线 | 影子层/TD-D(carried) | 随"图像优先档"档案组(跟练/白板/题目讲解)+ T4 跟练步骤图卡 |
| L5 | 双版面统一(规则版 vs 模型版) | 技术债观察 7 | 架构口径问题(结果不互认、无法交叉验证);ADR 先行(统一/并存+回灌),L 级 |
| L6 | 观察 6:首启自动下载缺失模型 | 技术债观察 | 下载入口已齐备,缺分发策略决策 |
| L7 | 词级时间戳(B8/A7) | 机制+数据清单 | 依赖 sherpa-onnx 上游暴露 token timestamps;提取函数+单测已就位 |
| L8 | engine.rs mpsc 无界 channel 背压(衍生观察,待核验) | 代码级盘点 | 长导入与实时 OCR 并发时请求可积压;现有 load_monitor/idle_governor 是否覆盖该场景需核验;若需有界队列/背压属 S-M 性能项 |
- AI 增强实装(Qwen-VL,mock 换真实适配器)、AI 补缝 unknown 区域、AI 参考图上下文(REQ-093)、AI 描述影子缓存(REQ-094 → image_caption 接线)、段落级"对这段补充"(接口已预留)、逐会话成本报表 UI(数据已备)
- 讲者影子列/embedding(V1.0 模型分发 G4)、掌握度建模 K1 输入(语速/停顿/speaker 已落列)
- 周报 A4(session_events/foreground_timeline 已备 dead_code 豁免)、foreground_timeline 载荷富化
REQ-055(AI 协议已实施)→ REQ-056 补缝 AI ─┬→ REQ-058 流程图语义重建
├→ REQ-093 AI 参考图上下文
└→ REQ-094 AI 描述影子缓存 → image_caption 接线
闪卡 REQ-019/020(三版顺延未排期)→ REQ-021 生成式复习 / REQ-022 黄金错误 / REQ-027 重点→闪卡
REQ-077 大纲标题(已实施)+ REQ-023 时间轴 → REQ-026 章节速览/思维导图
ADR-006 派生视图(已立项)→ D2 会话结束离线精修 / B2 跨信道交叉验证 / G1
G2 诊断面板 → 一切性能机制(先测量后优化)
S4 关键帧图集(已实施)→ V4 课后全量两遍解码(S4 已就绪 = 低挂果实)
REQ-067 图指纹(已实施)→ REQ-096 跨会话图关联
K2 测验 → REQ-097 测验引用图;E1 导出 → REQ-095 导出带图
| 果实 | 依据 | 前置状态 |
|---|---|---|
| V4 课后全量两遍解码(会话结束离线精修) | v0.6.0 缓做项 | S4 已就绪(流式+重打分+关键帧投票全链路可用),缺后台任务编排 |
| 逐会话成本报表 UI | v0.8.0 缓做项 | 成本数据已落库(note_ai_usage),缺展示层 |
| 段落级"对这段补充" | v0.8.0 缓做项 | 锚点接口已预留,随 AI 线消费 |
- REQ-026/027/028 版本冲突:需求池标 V1.1,v0.6.0.md:196 沿用清单标 V1.0——需统一口径
- REQ-025 状态过期:需求池"待评估"但核心(口语书面化/热词)已由 v0.4.0 REQ-040 + v0.8.0 REQ-141 提前兑现——应更新状态
| 主题 | 出现文档 | 置信度 |
|---|---|---|
| 已有信号接线 + 多信号投票(增量再检测/三信号章节/窗口进程信号) | mechanisms(A5/C1)、极限(S1/X2)、数据清单(C4/D1)、档案检测(#4/#7/#9) | ★★★ |
| 反馈闭环/用户纠错回流(无 LLM 的"学习") | 四份全部 | ★★★ |
| VideoProfile 档案化(管线配置化骨架) | mechanisms(E9)、极限(V1-V4)、档案检测(整篇) | ★★★ |
| 词级时间戳/精确对齐 | mechanisms(B8)、极限(T4/O4)、数据清单(A7 🟡)、档案检测(DTW) | ★★☆ |
| 关键帧图集/步骤卡 | mechanisms(B6)、极限(S4/V2)、数据清单(✅ 已兑现) | ★★★ 已兑现 |
| OCR→ASR hotwords 闭环/术语表自动发现 | mechanisms(M5/C3)、极限(T3/S3)、数据清单(D3 ✅)、档案检测(#20) | ★★☆ |
| 置信度/可信度审计("可校对学习原料"定位) | mechanisms(B3)、极限(O1)、数据清单(A2 ✅) | ★★☆ |
| 性能预算/采样调度/资源降级(先测量) | mechanisms(M4/E1/E5/G2)、极限(P1-P8) | ★★☆ |
| 会话结束离线精修/两遍解码 | mechanisms(D2)、极限(T4/O4) | ★★☆ |
| 会话检索+时间回跳/可携带导出 | mechanisms(C5/C7)、极限(O3) | ★★☆ |
| 剪贴板信号(隐私受控)/说话人标记/跨会话合并 | mechanisms(§1.5/A3/C8)、极限(X1/X5/O5) | ★★☆ 已兑现/已立项/低优先 |
- mechanisms 42 项中已落地:A1 音频预处理(REQ-041,默认关)、A3 说话人变化检测(v0.7.2 REQ-153)、A4 课件预热(pptx 最小版)、B4 版面/表格/公式结构化(v0.5.0)、B5 口语书面化(v0.7.5)、B6 步骤卡/图集(v0.5.0 M6)、B7 滚动字幕过滤、C1 章节检测、C2 重点标注、C3 术语表、C4 大纲、E9 档案、F2/F3 健康监测与失败可见化
- 数据清单 30 项:音频 9/字幕 2/画面 7/结构 6/行为 6/产物 8 绝大部分 ✅ 闭环;剩 A7 词级时间戳/C3 图像流/C6 图注/A8 讲者/视频元数据/关键词云
- 极限 L1-L4 分层:L1/L2 ✅、L3
⚠️ 部分、L4 ❌(LLM 专属,v0.8.0 后 AI 线) - 已否决勿重启:mpv IPC、信号源插件抽象、静音降频、零拷贝、实时增量融合、弹幕解析、浏览器扩展(除非新突破性依据)
- open 7 笔:TD-A(M1 已排)、TD-D(M2 已排)、TD-E/F(S2 已排)、TD-G(M3 已排)、TD-H(S4 已排)、TD-I(S3 已排)
- 观察 8 条:1/2/3/4/5/6/7/8(分别并入 M1/S5/S7/M5/L5/L6/L7)
- carried 4 笔(保持):TD-040(ffmpeg deliberate)、TD-2026-08-19-D(图像流→L4)、TD-F/G(既有)
- 影子层 8 模块:image_crop(S1)、image_stream_store(L4)、image_caption/ocr_confusion(AI 线)、interruption_detect(L2)、dtw_align(L3)、audio_route_probe(L1)、model_registry.list_versions(S6)、asr_dedupe 豁免(S6)