视频知识提取:一个视频能提取出哪些数据(非社交属性)
状态 : 部分已立项(v0.7.2,2026-08 用户裁决:说话人分离弱化版落地(A8)、采集信息面板(时长/合集/字幕,C/B 层复用))——本文为
前瞻整理:以"一个视频"为对象,逐项列出可提取的非社交属性数据(不含评论/点赞/弹幕等社交信号),标注已投入使用 / 已实现未接线 / 未实现 ;
已立项项登记 需求池 REQ-151/153 (v0.7.2),其余待裁决。
入口 :实时捕获(课堂助手,屏幕+系统音频)与 文件导入(ffmpeg 提音轨)两条链路。
状态图例 :
✅ 已投入 :采集 → 存储 → 至少一个消费端(UI/产物/检索/笔记)闭环
🟡 已实现未接线 :能力/存储已实现,但尚无消费端或未上 UI
⬜ 未实现 :规划中或明确裁决不做
落库位置:session_segments(转写)/ session_ocr_blocks(画面文字)/ session_images
(图集,文件系统)/ session_events(信号事件)/ session_artifacts(产物)/ 会话音频目录。
#
数据项
说明
入口
状态
A1
语音转写全文(ASR 段)
流式 Zipformer 边说边出 + 端点断句 + SenseVoice 整句重打分;含净化(重复压缩/幻觉过滤)、跨段去重、句子级合并切分
实时+导入
✅ 转写列表/融合/笔记/段搜索
A2
定稿置信度
重打分一致性相似度作为代理置信度(无法产出落 None,诚实未知)
实时+导入
✅ 落库 + 质量报告低置信筛选
A3
段音量
段内平均 RMS(重点标注"音量骤变"信号输入)
实时
✅ 落库 + 重点标注消费
A4
语速
字符数/段时长(字/秒)
实时+导入
✅ 落库(REQ-109)
A5
段前停顿
与上一段 end 的 gap(节奏/问答间隔特征)
实时+导入
✅ 落库(REQ-109)
A6
原始音频存档
会话 WAV(预处理前,供重跑/取证;30 天保留 + 磁盘预算清理)
实时
✅ 音频存档管理命令
A7
词级时间戳
每词起止时刻(跳转定位/逐词对齐用)
离线/精修路径
🟡 流式链路恒 None(B8 未接流式)
A8
讲者身份/讲者变化
多人对话的角色归属与切换点
—
⬜ 讲者影子列恒 None(V1.0 接线);detect_speaker_changes 已按 REQ-099 降级移除空转
A9
标点/分段
语义标点恢复(重打分未通过时补标点)
实时+导入
✅ 消费于定稿文本
#
数据项
说明
入口
状态
B1
字幕文本流
滚动/内嵌字幕检测(det),时间戳对齐(DTW 漂移校正)
实时+导入
✅ 字幕优先信道、融合、笔记
B2
外部字幕文件
导入时同名字幕文件(L1/L2 命中免 ASR)
导入
✅ 字幕直出路径
#
数据项
说明
入口
状态
C1
OCR 画面文字块
关键帧文字识别(PaddleOCR 系),含区域类型(表格/公式/代码/字幕区)、置信度、白边裁剪
实时+导入
✅ 画面要点 Tab、融合、图内文字检索
C2
关键帧图集
full 原图 + thumb 缩略图 + crop 裁剪图(WebP),按时间戳命名,预算按档案存储档位
实时+导入
✅ 最近画面条/图集/产物 key-image
C3
时间轴帧序列(图像流)
图像优先档档案(白板/跟练/游戏/题目)的全帧分级存储(书写过程即内容)
—
🟡 image_stream_store 存储层已实现未接线
C4
画面切换事件
帧 diff 判定(章节检测主信号;含长静音/音量骤变等事件流)
实时
✅ session_events + 章节检测消费
C5
关键图(帧聚类投票)
按信号(切换/用户截图/OCR 高置信/剪贴板)聚类选代表帧
实时
✅ 产物 key-image
C6
关键图图注
图内 OCR 高频词 × 转写摘要交叉的一句话图注(本地规则)
实时
🟡 影子层已实现(REQ-088),产物配图接线中
C7
图内文字检索
搜 PPT/板书里的词 → 命中图
实时
✅ 会话页图片搜索
#
数据项
说明
入口
状态
D1
章节/大纲
章节检测(多信号投票:长静音/帧切换/术语重复)+ 大纲条目(带时间戳)
实时+导入
✅ 会话页大纲视图
D2
步骤卡/步骤图卡
实操/跟练:帧聚类步骤边界(口令/练习段/示范交替三信号)
实时
✅ 产物 step-card(跟练配图待 M3 图注)
D3
术语表
高频术语自动构建(术语锚点)
实时+导入
✅ 网课产物 term-anchor
D4
口语书面化
语气词/重复压缩为书面语
实时+导入
✅ 笔记过滤链
D5
重点标注
三信号(音量骤变/关键帧 OCR 高置信/剪贴板信号)→ highlight 块
实时
✅ 产物 highlight
D6
摘要
摘要块(口播/播客/直播模板)
实时+导入
✅ 产物 summary
五、行为事件层(学习过程信号,非视频内容但由视频会话产出)
#
数据项
说明
入口
状态
E1
VAD 语音段 / 长静音
段落级语音活动与静音持续(节奏/章节信号)
实时
✅ session_events + 章节消费
E2
音量骤变
段间 RMS 突变(讲者强调时刻)
实时
✅ session_events + 重点标注
E3
剪贴板信号
课中复制内容(只存 30 字预览——隐私红线),高置信重点信号
实时
✅ session_events + 投票
E4
前台窗口切换
用户切换窗口的时间线(实践段标记锚点)
实时
✅ session_events(REQ-128)
E5
播放器行为
暂停/播放/倍速检测(难点信号)
实时
✅ session_events(REQ-125)
E6
会话暂停/恢复
硬暂停时间轴(冻结区间可见)
实时
✅ session_events
#
数据项
说明
状态
F1
讲义式笔记
网课/白板/题目/编程/未知:章节+段落+关键图+术语+小结
✅ 产物 + 转笔记
F2
步骤卡
实操/游戏教程/跟练
✅
F3
摘要文
口播/播客/直播:Claim+Quote+关键词
✅
F4
对话纪要
访谈:QA 对+Highlight+讲者(讲者待接线)
✅ QA/Highlight 已产出
F5
会议纪要
会议:决策/待办/议程
✅
F6
代码块
编程档案:OCR code 区重建代码块(含语言/时间范围)
✅
F7
表格/公式重建
表格结构重建 + LaTeX 公式
✅ 产物 table/formula 块
F8
笔记过滤/合并
UI 垃圾过滤/重复合并/碎片合并/低置信筛选(+可选 AI 复核)
✅
数据项
现状
潜在价值
卡点
词级时间戳(A7)
流式链路未产出
逐词跳转、逐词高亮、对齐精度
B8 需接流式词时间戳输出
讲者/说话人(A8)
恒 None
访谈纪要分人、会议 Action 归属
本地说话人聚类/分离成本
时间轴帧序列(C3)
存储层未接线
白板书写过程回放、跟练姿态序列
消费端(时间轴回放)未排期
图注(C6)
影子层
图集自动说明、笔记配图
产物配图接线
视频文件元数据(时长/分辨率/码率/编码)
未提取展示
会话列表排序/存储规划/画质提示
导入链路未做元数据读取
关键词云/词频统计
未实现
快速扫读一节课讲了什么
无排期
弹幕解析
明确裁决不做(直播档案"不做 OCR/弹幕")
弹幕情绪/补充信息
社交属性 + 成本,维持不做
一个视频当前已能提取 音/字/图/构/行/产 六层约 30 项数据 ,其中绝大部分已投入使用并闭环到
笔记/检索/产物;未投入的主要是"增强型数据"(词级时间戳、讲者、图像流、元数据、词频)——
它们不是缺失而是接线问题 :能力已具备或半具备,缺的是消费端排期。