先把视频分析拆成四层
第一层写直接观察:谁进入画面、手碰了什么、物件从哪里移到哪里、屏幕上确实出现了哪些字。第二层写实听对白,并保留说话人尚未确认的情况。第三层才写解释,例如某个动作改变了谁能使用一件物品;解释强度不能超过画面与声音。第四层列未知项,包括人物动机、镜头外协议、身份真伪、后续结果和创作者意图。
单帧能证明那一刻的可见状态,不能独自证明动作全过程。自动字幕能帮助寻找声音,不能自动证明字词、人名和说话者正确。背景简介能补人物关系,不能替当前镜头宣布人物做了什么。
可复制的视频分析两列核对表
| 项目 | 填写内容 |
|---|---|
| 当前问题 | <这段要确认的人物、动作或变化> |
| 可见事实 | <人物位置、物件状态、动作起止、画中文字> |
| 实听对白 | <原句或待确认片段;标明谁说话是否确定> |
| 支持到的变化 | <知识、目标、关系、权力、情绪或风险实际怎样改变> |
| 有限解释 | <由哪些画面和对白共同支持> |
| 不能推出 | <动机、身份、授权、结果或镜头外事件> |
| 需回看的范围 | <动作前提、执行、反应和本段结果> |
| 最终表述 | <具体、可追溯、保留未知的两三句分析> |
先填写左侧问题,再从完整片段补右侧证据。若“有限解释”找不到对应画面或对白,把它移到“不能推出”或删除。
原创片段:工具箱离开了桌面
下面是本文为教学设计的纸面素材,没有真实拍摄、模型分析或播放测试。社区修理活动在露天走廊举行。签到桌设在遮雨棚边缘,桌后靠墙还有一层不会淋雨的有顶置物架。片段开头,志愿者梅青把一个贴着“放映室转接头”的红色工具箱放到签到桌上。雨声逐渐变大,水滴开始打到桌角。
林陶进入画面,指着工具箱说:“这边要进水了,我先挪到棚里。”他双手拿起箱子,连续走到同一走廊的遮雨棚下,把箱子放在一张空椅上。镜头没有拍到他打开箱子,也没有交代他是否负责保管。
稍后,梅青回到签到桌,问:“红箱子呢?”另一名志愿者向遮雨棚方向看。林陶从画外回答:“在棚下,没开过。”梅青走到椅边,看见箱扣仍合着。她把箱子拿到签到桌后靠墙的有顶置物架上,说:“下次挪之前叫我一声。”林陶回答:“好。”片段停在工具箱留在干燥置物架上。
纸面素材支持箱子被挪动、挪动前桌角开始进水、箱扣在梅青查看时合着、箱子随后被放到有顶置物架。它没有验证箱内物品数量、林陶的身份权限、箱子是否全程无人接触,或他心里真正怎样想。
把越界的AI总结逐句修回来
越界版本可以写成:“林陶趁活动混乱偷走工具箱,被发现后谎称避雨,最后在证据面前归还赃物并认错。”这句话把移动写成偷窃,把林陶的解释判成谎言,把箱扣合着当成完整物品证据,还把“好”扩写成承认盗窃。
按核对表返修后:
雨声变大、水滴打到桌角后,林陶说桌边要进水,并把红色工具箱移到同一走廊的遮雨棚下。梅青找箱子时,他从画外说明位置;梅青看到箱扣合着,把箱子放到签到桌后的有顶置物架,并要求他以后移动前先通知。林陶答应这一项要求。片段没有核对箱内物品,也没有建立林陶的保管权限或更强动机。
返修保留了可读的冲突:梅青需要知道物件去向,林陶先移动后告知。它也保留真实结果:箱子停在干燥置物架上,双方形成下一次先通知的当前约定。
不要让单帧替完整动作讲故事
只看林陶拿箱子的单帧,容易把“持有物件”误写成“占有物件”。回看片段要覆盖动作前的条件、动作的连续过程、相关人物收到信息的时点、回应和本段实际结果。若中间有剪切,分别记录切前切后看见什么,不把两个地点或时点拼成一项连续事实。
分析人物情绪时也使用同样边界。皱眉、停顿和移开视线是可观察信号;“心虚”“嫉妒”“早有预谋”是解释,需要对白、行为序列或可靠上下文支持。证据不足时,直接写“梅青停顿后看向遮雨棚”,比替人物补内心更准确。
交付前做五项反向核对
- 把所有形容动机、身份和结果的词圈出,逐个指出画面、对白或可靠上下文。
- 暂时删掉深层解释,只读直接观察,确认它仍准确描述当前片段。
- 回到完整片段,检查分析有没有漏掉改变含义的前提、反应或当前结果。
- 检查画面文字与自动字幕是否经过实际核对,听不清的词保留待确认。
- 检查背景资料只补上下文,没有替当前镜头证明动作。
这套检查只提高纸面分析的可追溯性。真实视频的观看验收仍需查看当前源文件和完整输出。
常见问题
AI识别出人物表情,就能写人物动机吗?
表情可以作为当前可见反应记录,动机还需要对白、连续行为或可靠上下文。把表情、解释和未知项分开,避免把一次皱眉直接写成犯罪、欺骗或长期关系结论。
用 skill 来做
用 $video-recap 处理我提供的视频,只运行理解与分析阶段,写出理解索引和创作简报后停止。逐段分开可见事实、实听对白、有证据的解释和未知项;为每项解释标出对应时段。人物动机、身份、关系与结果缺少依据时保留未知,不把空转写当静音证明。
查看具体方法: 公开视频解说入口与理解阶段暂停点 · 视频理解中的事实、推断与不确定性边界 · 逐帧观察与深层分析提示模板 · 画面事实与粗粒度转写的数据边界