Skip to content

Latest commit

 

History

History
103 lines (83 loc) · 8.56 KB

File metadata and controls

103 lines (83 loc) · 8.56 KB

视频知识提取:一个视频能提取出哪些数据(非社交属性)

状态: 部分已立项(v0.7.2,2026-08 用户裁决:说话人分离弱化版落地(A8)、采集信息面板(时长/合集/字幕,C/B 层复用))——本文为 前瞻整理:以"一个视频"为对象,逐项列出可提取的非社交属性数据(不含评论/点赞/弹幕等社交信号),标注已投入使用 / 已实现未接线 / 未实现; 已立项项登记 需求池 REQ-151/153(v0.7.2),其余待裁决。

阅读约定

  • 入口:实时捕获(课堂助手,屏幕+系统音频)与 文件导入(ffmpeg 提音轨)两条链路。
  • 状态图例:
    • ✅ 已投入:采集 → 存储 → 至少一个消费端(UI/产物/检索/笔记)闭环
    • 🟡 已实现未接线:能力/存储已实现,但尚无消费端或未上 UI
    • ⬜ 未实现:规划中或明确裁决不做
  • 落库位置:session_segments(转写)/ session_ocr_blocks(画面文字)/ session_images (图集,文件系统)/ session_events(信号事件)/ session_artifacts(产物)/ 会话音频目录。

一、音频层(讲什么、怎么讲)

# 数据项 说明 入口 状态
A1 语音转写全文(ASR 段) 流式 Zipformer 边说边出 + 端点断句 + SenseVoice 整句重打分;含净化(重复压缩/幻觉过滤)、跨段去重、句子级合并切分 实时+导入 ✅ 转写列表/融合/笔记/段搜索
A2 定稿置信度 重打分一致性相似度作为代理置信度(无法产出落 None,诚实未知) 实时+导入 ✅ 落库 + 质量报告低置信筛选
A3 段音量 段内平均 RMS(重点标注"音量骤变"信号输入) 实时 ✅ 落库 + 重点标注消费
A4 语速 字符数/段时长(字/秒) 实时+导入 ✅ 落库(REQ-109)
A5 段前停顿 与上一段 end 的 gap(节奏/问答间隔特征) 实时+导入 ✅ 落库(REQ-109)
A6 原始音频存档 会话 WAV(预处理前,供重跑/取证;30 天保留 + 磁盘预算清理) 实时 ✅ 音频存档管理命令
A7 词级时间戳 每词起止时刻(跳转定位/逐词对齐用) 离线/精修路径 🟡 流式链路恒 None(B8 未接流式)
A8 讲者身份/讲者变化 多人对话的角色归属与切换点 — ⬜ 讲者影子列恒 None(V1.0 接线);detect_speaker_changes 已按 REQ-099 降级移除空转
A9 标点/分段 语义标点恢复(重打分未通过时补标点) 实时+导入 ✅ 消费于定稿文本

二、字幕层(画面内嵌文字时序流)

# 数据项 说明 入口 状态
B1 字幕文本流 滚动/内嵌字幕检测(det),时间戳对齐(DTW 漂移校正) 实时+导入 ✅ 字幕优先信道、融合、笔记
B2 外部字幕文件 导入时同名字幕文件(L1/L2 命中免 ASR) 导入 ✅ 字幕直出路径

三、画面层(看到什么)

# 数据项 说明 入口 状态
C1 OCR 画面文字块 关键帧文字识别(PaddleOCR 系),含区域类型(表格/公式/代码/字幕区)、置信度、白边裁剪 实时+导入 ✅ 画面要点 Tab、融合、图内文字检索
C2 关键帧图集 full 原图 + thumb 缩略图 + crop 裁剪图(WebP),按时间戳命名,预算按档案存储档位 实时+导入 ✅ 最近画面条/图集/产物 key-image
C3 时间轴帧序列(图像流) 图像优先档档案(白板/跟练/游戏/题目)的全帧分级存储(书写过程即内容) — 🟡 image_stream_store 存储层已实现未接线
C4 画面切换事件 帧 diff 判定(章节检测主信号;含长静音/音量骤变等事件流) 实时 ✅ session_events + 章节检测消费
C5 关键图(帧聚类投票) 按信号(切换/用户截图/OCR 高置信/剪贴板)聚类选代表帧 实时 ✅ 产物 key-image
C6 关键图图注 图内 OCR 高频词 × 转写摘要交叉的一句话图注(本地规则) 实时 🟡 影子层已实现(REQ-088),产物配图接线中
C7 图内文字检索 搜 PPT/板书里的词 → 命中图 实时 ✅ 会话页图片搜索

四、结构层(内容组织)

# 数据项 说明 入口 状态
D1 章节/大纲 章节检测(多信号投票:长静音/帧切换/术语重复)+ 大纲条目(带时间戳) 实时+导入 ✅ 会话页大纲视图
D2 步骤卡/步骤图卡 实操/跟练:帧聚类步骤边界(口令/练习段/示范交替三信号) 实时 ✅ 产物 step-card(跟练配图待 M3 图注)
D3 术语表 高频术语自动构建(术语锚点) 实时+导入 ✅ 网课产物 term-anchor
D4 口语书面化 语气词/重复压缩为书面语 实时+导入 ✅ 笔记过滤链
D5 重点标注 三信号(音量骤变/关键帧 OCR 高置信/剪贴板信号)→ highlight 块 实时 ✅ 产物 highlight
D6 摘要 摘要块(口播/播客/直播模板) 实时+导入 ✅ 产物 summary

五、行为事件层(学习过程信号,非视频内容但由视频会话产出)

# 数据项 说明 入口 状态
E1 VAD 语音段 / 长静音 段落级语音活动与静音持续(节奏/章节信号) 实时 ✅ session_events + 章节消费
E2 音量骤变 段间 RMS 突变(讲者强调时刻) 实时 ✅ session_events + 重点标注
E3 剪贴板信号 课中复制内容(只存 30 字预览——隐私红线),高置信重点信号 实时 ✅ session_events + 投票
E4 前台窗口切换 用户切换窗口的时间线(实践段标记锚点) 实时 ✅ session_events(REQ-128)
E5 播放器行为 暂停/播放/倍速检测(难点信号) 实时 ✅ session_events(REQ-125)
E6 会话暂停/恢复 硬暂停时间轴(冻结区间可见) 实时 ✅ session_events

六、产物层(落成可消费的知识)

# 数据项 说明 状态
F1 讲义式笔记 网课/白板/题目/编程/未知:章节+段落+关键图+术语+小结 ✅ 产物 + 转笔记
F2 步骤卡 实操/游戏教程/跟练 ✅
F3 摘要文 口播/播客/直播:Claim+Quote+关键词 ✅
F4 对话纪要 访谈:QA 对+Highlight+讲者(讲者待接线) ✅ QA/Highlight 已产出
F5 会议纪要 会议:决策/待办/议程 ✅
F6 代码块 编程档案:OCR code 区重建代码块(含语言/时间范围) ✅
F7 表格/公式重建 表格结构重建 + LaTeX 公式 ✅ 产物 table/formula 块
F8 笔记过滤/合并 UI 垃圾过滤/重复合并/碎片合并/低置信筛选(+可选 AI 复核) ✅

七、未投入使用项汇总(值得关注的增量)

数据项 现状 潜在价值 卡点
词级时间戳(A7) 流式链路未产出 逐词跳转、逐词高亮、对齐精度 B8 需接流式词时间戳输出
讲者/说话人(A8) 恒 None 访谈纪要分人、会议 Action 归属 本地说话人聚类/分离成本
时间轴帧序列(C3) 存储层未接线 白板书写过程回放、跟练姿态序列 消费端(时间轴回放)未排期
图注(C6) 影子层 图集自动说明、笔记配图 产物配图接线
视频文件元数据(时长/分辨率/码率/编码) 未提取展示 会话列表排序/存储规划/画质提示 导入链路未做元数据读取
关键词云/词频统计 未实现 快速扫读一节课讲了什么 无排期
弹幕解析 明确裁决不做(直播档案"不做 OCR/弹幕") 弹幕情绪/补充信息 社交属性 + 成本,维持不做

八、结论(一句话)

一个视频当前已能提取 音/字/图/构/行/产 六层约 30 项数据,其中绝大部分已投入使用并闭环到 笔记/检索/产物;未投入的主要是"增强型数据"(词级时间戳、讲者、图像流、元数据、词频)—— 它们不是缺失而是接线问题:能力已具备或半具备,缺的是消费端排期。