已接受(v0.12.0 M5,2026-08-23 用户裁决;已实施交付——精修侧 + 帧侧均落地;v0.12.4 补齐残留:直播/导入两条 region OCR 分支已删,展示层按 kind 分派纯图屏,真机验证待执行)
2026-08-23
本地 PaddleOCR 对视频全帧画面要点提取质量差(动态模糊/复杂版面/小字/干扰物)——同一引擎在字幕/图文场景效果好(质量债)。且图片上传是最敏感的隐私动作,需独立授权闸门。
- 本地 OCR 只做字幕(视频)+ 图文采集(photo 会话)——视频会话不再做全帧 OCR。
- 关键帧纯图(存图不识别);存图触发从"OCR 文本非空"解耦为"grid diff 变化 + 时间间隔"。
- vision-exp 图片理解(可选增强,仅视频会话,并入 AI 精修):不做独立提取命令——精修时若
vision_refine_enabled开启,屏卡图随转写文本一并送deepseek-v4-flash-vision-exp(content 数组多模态),精修输出直接含画面要点;屏卡缩略图走现有attach_images。 - 图文会话 OCR 已足够,不启用 vision(用户决策:仅视频会话使用)。
- 图片精修可选性:
vision_refine_enabled开关(默认关)——图片上传最敏感,独立闸门;关闭则精修纯文本(现有行为零变化)。 - AI 强化链条总开关:复用现有
AiSettings.enabled(全局闸门,默认关)——关闭则采集期领域识别/AI 复核/精修/补充全部拒绝(已有content_gate门控)。
隐私红线(ADR-010 扩展):图片上传默认关(vision_refine_enabled 默认 false + 全局 enabled 默认关);关闭时精修走纯文本(零变化);图片仅随精修切片请求上传,不作独立提取。
- 优点:无架构改动。
- 缺点:本地 OCR 在动态模糊/复杂版面根本性不可靠——调参治标不治本,且维持全帧 OCR 的算力/成本。
- 优点:质量债根治(关键帧纯图,不识别);画面要点经 vision-exp 高质量提取并并入精修;图片上传独立闸门 + 默认关,隐私可控。
- 缺点:画面要点提取依赖云端 vision(需授权 + 有条件);离线降级 = 无画面要点(纯图存证)。
- 适用场景:视频会话以转写为主体,画面要点为增强。
本地 OCR 质量差的根因是引擎对视频全帧的鲁棒性不足——降级为"只做字幕/图文采集"规避该根因。画面要点本属增强,交给 vision-exp 高质量提取并在精修时随切片上云,同时以独立闸门 + 默认关满足图片隐私红线。
- 视频会话不再产生低质全帧 OCR;画面要点提取质量提升(vision-exp);图片上传可控。
- 关闭开关时视频会话精修无画面要点(纯文本);图片随精修上云需用户授权(默认关)。
- vision-exp 画面要点抽取质量依赖云端模型(未实测校准);需真机验证采集端改动(video 会话不再 OCR 全帧)。
- 视频会话关键帧纯图(无 OCR 文字);开启图片开关后精修请求含屏卡图、输出含画面要点;关闭开关精修纯文本零变化;图文会话不受影响;
enabled=false时精修命令拒绝。
- ADR-010: AI gap-filling 隐私契约(本 ADR 扩展图片授权)
- ADR-011: grid diff OCR 触发
- docs/versions/v0.12.0.md(视频画面要点降级 + vision 提取 M5)