头脑风暴机制摘要:本地课堂助手 — 功能完善与性能提升方向(v0.4.0 之后)
状态 : 前瞻研究(2026-08,v0.4.0 规划完成后产出)
用途 : 本文档是机制摘要 ——面向其他 AI 模型的头脑风暴输入。阅读者无需访问本仓库,凭本文档即可理解系统现状、已排期机制与待挖掘空间,并产出新的机制候选。
关联 : v0.4.0 规划 · 需求池 · 上一轮头脑风暴:无云端 AI 的视频内容提取极限 · 技术债清单
0. 给其他 AI 模型的使用说明(头脑风暴任务书)
任务 :阅读 §1(系统现状)→ §2(外部研究)→ §3(机制候选清单),然后:
提出未被 §3 列出的新机制 (功能完善 / 性能提升 / 准确性 / 可靠性 / 架构);
或对 §3 中已列机制给出更优实现路径 / 更小成本的替代方案 ;
或指出 §3 中与现有机制冲突、冗余、或违反约束 的条目并说明理由。
硬约束(铁律) :本地优先——数据不出本机,所有云端能力必须有本地兜底路径;不引入需要在线下载才能编译的依赖(本机 TLS 拦截,UnknownIssuer);单文件 ≤300 行、纯逻辑与副作用分离、防御性编程(超时/重试/降级);Windows-only(Tauri 2 + Rust)。
评分标准 :可行性(1-5,依赖/前置条件/实现成本)× 影响力(1-5,用户可感知价值或资源收益)× 创新性(1-5,是否超越"再实现一遍现成方案")。注明前置 spike 与风险。
产出格式建议 :表格(编号 / 机制名 / 原理 / 为什么有效 / 成本 / 风险 / ROI / 建议时机:可并入 v0.4.0 / v0.5.0 / V1.0 / 远期)。
禁止 :重复提出 §1.5 已否决清单中的机制;提出违反本地优先铁律的方案。
产品 :熵减(Entropydecrease)——面向技能自学者 (化妆/编程/乐理/绘画等自我提升领域)的视频知识提取与持久化桌面应用。
核心场景 :用户观看教学视频/网课/实操演示时,应用实时捕获系统音频 + 目标窗口画面 ,本地 ASR + 本地 OCR 提取文本,规则拼接为笔记初稿;支持视频文件导入 第二入口(字幕优先:有字幕直出 100% 准确,无字幕 fallback ASR)。
MVP 对标 :通义听悟/讯飞听见级别的视频知识提取与持久化,但全本地、无云依赖 。
进度 :v0.1.0(文件导入 ASR/OCR/拼接/笔记)→ v0.2.0(实时捕获链路)→ v0.3.0(文件导入+字幕优先+融合异步化,代码已交付,真机验收待执行)→ v0.4.0 规划中 (课堂助手本地模式完成 + 实时性/准确性/资源三维优化)。
输入信号 引擎池(模型常驻,FFI 隔离) 产物
[WASAPI 环回] ──► 音频块 ──► VAD ──► 流式 Zipformer ──┐
[DXGI/GDI] ────► 帧 ──► 变化检测 ──► 字幕区/全帧 OCR ─┤
[ffmpeg 导入] ──► 音轨+关键帧 ──► 分窗 ASR / 帧 OCR ──┤
▼
融合(纯规则:字幕权威+ASR补缝)──► SQLite 三表
SenseVoice 重打分(一致性校验) (sessions/segments/
事件流 partial/final/字幕/OCR/状态 ocr_blocks)
──► React 前端(实时面板/详情/笔记)
──► V1.0 可选:云端 Qwen-VL 增强(默认关,离线降级本地拼接)
引擎池 (engine.rs):ASR/OCR 双 worker 线程,模型只加载一次,规避 FFI Send/Sync;请求经 mpsc channel 同步等待。
双速率调度 (ADR-002/005):字幕区 1-2fps、全帧 0.2-0.5fps;变化检测(分块 hash)过滤无变化帧。
字幕 OCR 投票 (subtitle_ocr.rs):同组样本字符多数投票纠错;编辑距离比例阈值判组;滚动字幕雏形过滤。
融合 (fusion.rs,纯规则):字幕段权威 → ASR 补缝(gap>1s)→ 重叠校对(编辑距离 ≤2 字幕胜出);停止后后台融合(REQ-031),无字幕短路。
流式 ASR (streaming_asr.rs):partial 节流推送(≥150ms)→ 端点断句 final → 重建流(支持热词)→ SenseVoice 整句重打分(懒加载)。
会话数据 :sessions / session_segments / session_ocr_blocks 三表;时间戳统一会话纪元;句起时间戳 = Final 后首个非静音块。
模型 :SenseVoice int8(离线)+ streaming-zipformer fp16(流式,~650MB)+ Silero VAD + oar-ocr(PP-OCRv6,ONNX)+ ffmpeg(外部二进制)。
1.3 已实现机制清单(v0.1.0–v0.3.0,勿重复提出)
域
已实现机制
采集
WASAPI 环回(SubFormat 防御、墙钟时间戳、指数退避重连);DXGI Desktop Duplication + GDI 降级(远程/锁屏);窗口裁剪 + DPI;关闭保护;周期重建自愈
ASR
流式 Zipformer(partial 节流/端点断句/静音隔块喂入/尾句 flush 去重)+ SenseVoice 重打分 + hotwords 注入(空热词防崩溃)
OCR
底部 1/4 字幕区裁剪 + 全帧兜底;双速率采样;变化检测漏斗;多帧投票纠错;滚动字幕过滤雏形;960px 输入缩小;内存图像识别(免磁盘)
融合
纯规则四规则融合;停止异步化 + 无字幕短路;会话纪元统一时间戳;句起/句尾校正
存储
SQLite 三表 + 批量原子事务;会话 CRUD/检索(FTS5 基础);崩溃 failed 状态;50MB 字幕上限
前端
实时活动面板(最近 6 条转写/4 条画面要点);停止过渡态超时兜底;事件携带后端时间戳
1.4 已排期机制(v0.4.0 M0–M6,勿重复提出)
里程碑
机制
M0
v0.3.0 收尾:真机验收、TD-033(窗口跨显示器重建)
M1
OCR GPU 卸载:DirectML EP + 三层检测(DXGI 硬件门槛/ORT 原生回退/微基准校准)+ 回退链 + 状态 UI
M2
动态字幕区域:det 驱动 ROI 锁定 + 周期重扫 + 底部先验
M3
实时字幕体验:partial 先行上屏(灰→黑静默替换)+ hash 去重短路
M4
采样预算制(字幕区 ≤2fps / 全帧 ≤0.5fps)+ 高负载/电池降级 + VAD 采样旋钮
M5
热词/替换词表 CRUD + ASR hotwords 注入 + OCR 替换纠错 + OCR 高频词一键入热词
v0.4.0 明确不做 :闪卡(REQ-019/020);时间轴回放与可编辑(REQ-023,V1.0);AI 问答与云端精修(REQ-024/025,V1.0);零拷贝(已裁决无收益);ASR GPU(预留 DeviceConfig 扩展位)。
1.5 已否决 / 搁置清单(勿重复提出,除非有新的突破性依据)
项
否决/搁置理由
mpv IPC 信号源
已决策不做(用户覆盖面窄、ROI 低,2026-08-18)
信号源插件抽象
无第一实例,随 mpv 否决搁置
剪贴板捕获(白名单)
隐私设计未决(涉安全红线),须 ADR + 授权交互后方可重启
浏览器扩展(B站/YouTube CC 直取)
交付物形态变重(签名/更新渠道),远期
说话人嵌入(完整 diarization)
本地质量待验证(可考虑降级为"说话人变化检测",见 A3)
跨会话去重(embedding 相似度合并)
搁置(无本地 embedding 选型)
实时增量融合
语义不成立(字幕 end_ms 靠下一字幕补齐、gap 判断需字幕全集)
静音降频
与笔记目标相悖,已裁决不做(v0.4.0 M4 只做"静音期全帧提频")
零拷贝帧传递
当前负载下无收益
2.1 流式 ASR 前沿(sherpa-onnx 生态)
热词/上下文偏置(contextual biasing)是流式识别准确率的主流提升手段 ,本项目 M5 已排期;更深一层是"上下文无关的自举语言模型"(会话内 n-gram 统计重排,见 B1)。
两遍解码(two-pass) :流式粗识别 + 离线模型精修,本项目已有 SenseVoice 重打分雏形;完整版是"会话结束全量两遍解码"(D2)。
sherpa-onnx 提供 speaker embedding / 说话人变化检测(SCD)ONNX 模型 ,可在 VAD 间隙做音色相似度比对 → 轻量"谁在讲"标记(A3 前置 spike 即可验证质量)。
forced alignment(强制对齐) 可产出词级时间戳 ,用于精确句边界(替代 end_ms 近似)、关键词时间轴、融合 gap 判断(B8)。
RNNoise :10ms 帧、~3ms 延迟、单核 ~3-5% CPU,广泛用于键盘/风扇/环境噪声抑制,常兼作 VAD 信号。注意 :环回捕获的是"成品音频"(播放器已混好),降噪收益需实测校准——应做成可开关 + 微基准对比 (A1)。
AGC(自动增益)对音量忽大忽小的课程(多人发言、远近麦克风差异)有实测收益;直流偏置/削波检测为廉价防御。
DXGI Desktop Duplication 是本地会话性能最优路径(OBS 主力),但远程桌面/锁屏不可用(本项目已 GDI 降级);Windows.Graphics.Capture(WGC) 更稳健(含远程桌面),但 WinRT 异步模型与 Rust 线程集成成本高、帧回调性能略逊——作为长期演进方向保留,不构成当前替换理由 。
帧元数据(DXGI_OUTDUPL_FRAME_INFO.AccumulatedFrames)可做"未变化帧跳过"的零成本二次判断(E7)。
关键帧思路(OBS 式):只在变化矩形内拷贝/检测,可进一步降低采集 CPU(当前为全帧 BGRA 转换 + 分块 hash)。
2.4 OCR 与 ONNX Runtime 性能
DirectML 不挑显卡 (本项目 M1 正做);量化(int8/fp16)与输入缩小 (近似平方级降延迟,本项目已做 960px)是确定性收益项。
ORT 运行时存在多个零成本调优点 :intra-op 线程数、enable_cpu_mem_arena、图优化级别(默认可能非 ENABLE_ALL)、线程亲和性——需核对 oar-ocr/sherpa crate 是否暴露 SessionOptions(oar-ocr 0.9.1 已确认暴露 ort_session 配置,M1 已用)(E2)。
版面分析/表格/公式识别(PaddleOCR 系)是板书/幻灯片结构化的现成路径 (B4);公式可 LaTeX 化(纯规则渲染)。
崩溃恢复的行业基线:段级落库 + 幂等续传 (本项目已有 failed 状态与批量事务);导入任务应可断点续跑(F1)。
资源健康监测(磁盘/模型完整性/引擎存活)→ 状态徽标,是长会话产品的必备项(F2)。
编号规则:A=信号源与输入前端 / B=提取与识别质量 / C=内容组织与产物形态 / D=反馈闭环与学习回路 / E=性能与资源 / F=可靠性与韧性 / G=架构与可扩展性。
时机标注:[v0.4] = 可低成本并入 v0.4.0;[v0.5] = v0.4.0 之后下一个版本;[V1.0] = 已排 V1.0 或需前置;[远期] 。
#
机制
原理
为什么有效
成本
风险
时机
A1
音频预处理链(可选) :RNNoise 降噪 + AGC 自动增益 + 削波检测
采集后、VAD 前插入 DSP 纯函数;可开关
键盘/风扇/环境噪声是 ASR 主要错误源;音量差异破坏 VAD 阈值
低(RNNoise ~1MB 模型 + 纯函数封装;需微基准)
环回是成品音频,降噪可能损伤音质——必须实测校准 + 默认关
[v0.4]
A2
声道策略 :立体声环回能量选优/合并
采集后按 RMS 选能量高的声道
单声道混入杂音时另一声道更干净;零模型成本
极低
声道语义因播放器而异,需实测
[v0.4]
A3
说话人变化检测(SCD 弱化版 diarization) :sherpa-onnx speaker 模型在 VAD 间隙对比音色向量 → "讲者切换"事件
转写段标注讲者,多讲者课堂可读性大增;为会议类档案(V1)铺路
中(新模型 + 特征提取;前置 spike 验证质量)
完整 diarization 质量不佳,但"变化检测"弱化版(不聚类身份,只标记切换)成功率显著更高
[v0.5]
A4
课件预热(课前导入) :课前导入 PPT/PDF → 本地文本提取 → 自动生成热词/替换词预热 + 章节先验
把学习内容前置到"课前 5 分钟",实时链路零成本受益
中(PPT/PDF 解析 + 词表预热管线)
PDF 解析(文本/图像混合)质量不一
[v0.5]
A5
窗口标题/元数据信号 :捕获目标窗口标题 → 章节语义暗示("PPT-第3章"/IDE 文件名)
零成本辅助信号,可进章节检测投票(C1)
极低
标题噪声大,需白名单规则
[v0.4]
#
机制
原理
为什么有效
成本
风险
时机
B1
会话自举 n-gram 语言模型校正 :会话内已确认文本构建统计 LM → 对后续 OCR/ASR 结果做候选重排
专业术语在会话内反复出现,自举比外部语料更贴合
中(统计 LM 纯 Rust 可做)
冷启动期样本不足;与热词机制(M5)部分重叠,需区分定位(热词=词级加权,LM=句级重排)
[v0.5]
B2
跨信道交叉验证(RAID 思路) :ASR / 字幕 OCR / 字幕文件三源按时间轴对齐互校
冗余信道互相纠错,超出 ADR-005 的编辑距离 ≤2 浅层版本
中(对齐 + 投票纯函数;需 ADR-006 派生视图配合才不污染原始段)
三源时间戳对齐复杂
[V1.0]
B3
置信度落库 + 低置信标记 :OCR block score / ASR 置信度 → 段级 confidence → "需人工校对"视图
把"提取物定位"从成品笔记改为可校对学习原料 (O1),用户信任度提升
中(模型是否暴露置信度需 spike)
oar-ocr 只有 score 无置信度时退化为启发式
[v0.5]
B4
板书/幻灯片结构化 :版面分析 + 表格/公式/代码块识别(PaddleOCR 系模型)
实操/课件课的核心信息在画面不在语音;公式 LaTeX 化、代码块结构化存储
中高(新模型 + 结构化 schema)
模型体积与准确率权衡
[V1.0]
B5
口语书面化(本地规则版) :语气词过滤、重复整理、标点恢复(纯规则+统计,无 LLM)
转写产物从"语音流"变"可读文本",笔记质量直观提升
中(规则工程,需语料校准)
过激改写损伤原意——必须可逆(保留原文段)
[v0.5]
B6
关键帧图集 / 步骤卡 :感知哈希聚类相似帧 → 画面簇 = 一个操作步骤 = 簇首帧 + 时间范围
实操类视频(化妆/手工/软件操作)唯一有效形态(S4,上轮评估第 1 名)
中(聚类纯函数 + 前端画廊 UI)
独立前端工作量;簇边界质量需 spike
[v0.5]
B7
滚动字幕/弹幕强过滤 :长公共子串检测 + 滚动方向判定
歌词/弹幕污染字幕权威源
低(纯函数增强)
误杀正常切换字幕(阈值需校准)
[v0.4]
B8
词级时间戳(forced alignment) :离线对齐产出词级时间戳
精确句边界(替代近似)、关键词时间轴、融合 gap 判断、未来"点击词跳转"
中(离线路径跑对齐;sherpa-onnx 已支持)
流式路径无对齐(仅离线/课后精修路径可用)
[v0.5]
#
机制
原理
为什么有效
成本
风险
时机
C1
三信号章节检测 :画面切换(已有)+ 长静音(已有)+ n-gram 话题重合度下降,三票同刻 → 章节边界
长视频结构化刚需(S1);全部信号已存在,纯规则融合
低中
阈值调参需样本
[v0.5]
C2
重点候选标注 :重复短语 ≥2 次 / 音量语速骤变(DSP)/ OCR 文本持续停留 N 帧 → 重点标记
笔记初稿直接带重点(S2),学习回路(D3)前置
中(DSP 特征 + 规则)
误标率需用户反馈校准(接 D1)
[v0.5]
C3
术语表自动构建 :OCR 高频词 × ASR 低频词交叉 → 候选术语 → 用户确认 → 反哺 hotwords + 笔记词汇表
M5 只做"一键加入",本机制做自动发现 (S3),闭环更完整
中
候选质量需确认 UI 把关
[v0.5]
C4
大纲视图生成(纯规则) :OCR 大字块/固定位置标题检测 + 幻灯片标题提取 → 课程大纲
规则可做的"章节速览"(REQ-026 前置),零 LLM
低中
标题检测误判需阈值校准
[v0.5]
C5
会话检索 + 时间回跳 :FTS5 已有基础,补"搜索结果 → 点击跳转视频时刻"
知识回找的核心体验(O3/REQ-023 前置)
中(依赖 C6 或实时录制)
无录制则只能跳转"转录时刻"无画面
[V1.0]
C6
会话视频录制(可选) :采集中可选录制低帧率视频(H.264 或关键帧序列)+ 时间戳对齐存储
回放/回跳/步骤卡的地基;实时链路已有帧流,增量成本
中高(编码器 + 磁盘管理)
磁盘占用;隐私(用户自选开启)
[V1.0]
C7
导出体系 :SRT/VTT 字幕导出、Markdown 笔记导出、带时间戳引用格式
学习产物可携带(进 Anki/其他工具),生态价值
低
—
[v0.5]
C8
跨会话合并去重 :n-gram 相似度聚类 → 课程级知识体
多遍观看同一课程时合并(O5)
中高
无本地 embedding 选型(上轮搁置)
[远期]
#
机制
原理
为什么有效
成本
风险
时机
D1
用户确认回路 :校对编辑 → 反哺规则参数(去重窗/编辑距离阈值/hotwords 权重/替换词)
无 LLM 的"学习"(O2);用户编辑是最廉价的高质量标注
中(UX + 参数化改造)
参数自动调整需"可回滚 + 透明展示",防失控
[v0.5]
D2
会话结束离线精修 :实时粗稿 + 后台两遍解码 + 全量融合 + 多帧投票 + 词级对齐 → 离线级产物
实时体验与离线质量兼得(O4);M3 的静默修正从"句级"升"会话级"
中(后台任务 + 派生视图前置)
与 ADR-006(REQ-032)强耦合
[V1.0]
D3
重点标记 → 闪卡联动 :C2 重点 → 一键生成闪卡(REQ-027);闪卡本体(REQ-019/020)顺延后跟进
从"提取"到"记住"的闭环,竞品无此链路
中(闪卡顺延后重排期)
依赖 C2 质量
[V1.0]
D4
学习统计 :会话时长/语音占比/停顿频率/OCR 要点数 → 学习报告
轻量差异化,成本低
低
指标定义需产品确认
[v0.5]
#
机制
原理
为什么有效
成本
风险
时机
E1
ORT 运行时调优 :intra-op 线程数 / CPU memory arena / 图优化级别 / 线程亲和性
零成本确定性收益;M1 已确认 oar-ocr 暴露 SessionOptions,sherpa 侧需核对
低(配置项 + 基准对比)
线程数配置不当反伤实时性(需基准)
[v0.4]
E2
ASR 模型档位 :设备能力检测(核数/内存/AVX)→ 选择 int8/小模型/关闭重打分
低配机可用性;与 M1 的 DeviceConfig 扩展位合并
中(模型分发复杂度上升)
多档位 = 多模型体积/测试面
[v0.5]
E3
启动加速 :模型 mmap/预加载 + 首会话前后台预热 + WebView 懒加载
"双击到能录"秒级体验;引擎池已常驻,补预热窗口
低中
预热与用户手动启停的时序竞态
[v0.4]
E4
内存有界 :会话窗口滑出即弃内存(落库即弃);SenseVoice 重打分引擎按需加载/卸载
长会话内存稳定(ADR-003 遗留评估项)
低
重打分卸载策略影响修正延迟
[v0.5]
E5
OCR 结果缓存(LRU) :区域感知哈希 → 结果缓存;A→B→A 帧变化不重复识别
变化检测只过滤"无变化",本机制过滤"变回去了";PPT 翻页往返典型场景
低(纯增量)
缓存键设计(区域+缩略哈希)需防碰撞
[v0.4]
E6
电量感知降级 :电池模式 → 采样降档 + 禁 GPU OCR
M4 已有负载降级,补电源维度(P8 扩展)
低
Windows 电源事件 API 细节
[v0.5]
E7
采集链路零分配 :staging 纹理复用、BGRA→RGB 内联、DXGI AccumulatedFrames 跳过判断
采集 CPU 占比下降(当前为开销排序第 3 位)
低中
零拷贝已否决,本项是"低分配"不越界
[v0.5]
E8
前端渲染性能 :时间轴/转写流虚拟列表、详情页分页查询、事件合并
长会话(数千段)UI 卡顿预防
中
—
[v0.5]
E9
视频类型档案(VideoProfile) :按内容类型(实操/代码/会议/PPT)预设采样策略与产物形态
管线配置化(V1 全面版):一次调优多处受益;v0.4.0 已显式化"字幕/无字幕"二态
中
档案数量与维护成本权衡
[v0.5]
#
机制
原理
为什么有效
成本
风险
时机
F1
导入任务断点续跑 :分段转写进度持久化 + 中断恢复
大视频导入(30 分钟+)中断不重来
中(进度状态机 + 恢复路径)
与现有导入管线耦合
[v0.5]
F2
资源健康监测 :磁盘空间 / 模型完整性 / 引擎存活巡检 → 状态徽标
长会话产品的必备项;磁盘写满崩溃是最常见隐性故障
低
—
[v0.4]
F3
静默失败可见化 :OCR/ASR 失败计数 → 会话摘要提示
TD-001 已做笔记侧警告段落,扩展到会话详情
低
—
[v0.4]
F4
崩溃恢复增强 :崩溃后"恢复会话"提示 + 续传(段级落库已有)
长时间课堂崩溃不丢已提取内容
中
恢复 UI 与现有会话列表集成
[v0.5]
#
机制
原理
为什么有效
成本
风险
时机
G1
会话派生视图 (原始段与融合轴分离 + fused_at)
B2/D2 的地基;支持重算融合/可信度审计(REQ-032/ADR-006 已立项)
中高(数据模型变更,涉 ADR-004/005)
迁移兼容
[V1.0]
G2
本地诊断面板 :帧率/延迟/CPU 曲线/预算命中率(开发期可隐藏)
优化决策的数据基础(P 系列机制全部依赖实测);当前开销排序是代码推断非实测
中(指标埋点 + 面板)
埋点性能开销需自控
[v0.4]
G3
性能基准护栏(CI) :合成音频/合成帧 golden 测试 + 延迟/CPU 基准回归门禁
防止优化回退(本项目测试文化强,缺口在性能维度)
中
基准机器差异需归一化
[v0.5]
G4
模型按需分发 :只下载设备所需档位(int8/完整/DML 包),增量校验
安装/首启体验(当前流式模型 650MB 全量)
中
分发矩阵复杂化
[v0.5]
排名
机制
可行性
影响力
创新性
时机建议
一句话理由
1
E1 ORT 运行时调优
5
4
2
[v0.4]
零成本确定性收益,立即做
2
E5 OCR 结果缓存
5
3
3
[v0.4]
小增量,PPT 往返场景显著
3
A1 音频预处理链(可开关)
4
4
3
[v0.4]
课堂环境噪声是 CER 主要来源,需实测校准
4
G2 本地诊断面板
4
4
3
[v0.4]
一切优化决策的数据前提
5
A5 窗口标题信号
5
2
3
[v0.4]
零成本辅助信号
6
B7 滚动字幕强过滤
4
3
2
[v0.4]
纯函数增强
7
F2/F3 健康监测与失败可见化
4
3
2
[v0.4]
长会话可靠性基线
8
C1 三信号章节检测
4
4
3
[v0.5]
结构化刚需,信号全现成
9
B6 关键帧图集/步骤卡
4
5
4
[v0.5]
实操类唯一有效形态(上轮第 1 名)
10
A3 说话人变化检测
3
4
4
[v0.5]
多讲者课堂可读性,spike 决定去留
11
B3 置信度落库
3
4
3
[v0.5]
"可校对原料"定位的产品基石
12
B5 口语书面化(本地版)
4
4
2
[v0.5]
笔记可读性直观提升
13
C3 术语表自动构建
4
3
3
[v0.5]
M5 闭环的自然延伸
14
D1 用户确认回路
3
4
4
[v0.5]
无 LLM 的自我进化
15
B8 词级时间戳
3
4
3
[v0.5]
精确对齐的地基
本摘要的机制清单是v0.4.0 规划之外 的增量空间;v0.4.0 内已有 M0–M6 的机制(§1.4)不应重复提出,但可与新机制组合 (如 B3 依赖 M1 的 device status、C3 依赖 M5 的热词基础设施)。
全部机制遵循本地优先铁律:任何"云端可选"方案必须带本地兜底(当前唯一云端项是 V1.0 的 Qwen-VL 可选增强,默认关闭)。
性能类机制的共同前提是先测量后优化 (G2 诊断面板优先于一切 P 系列机制)。