先说清:拆参考片是为下一条片攒方法和数值
video-reference 是按需使用的拆片技能,不在默认生产路径上。它把一部已完成的成片拆成两层:这条片怎么做的(事实),换一份素材还能怎么用(方法)。事实只留在本地,导出的 production_reference.json 只含方法和测得的数值。
它不调用 MiMo 或任何 LLM,不打分,也不判断你的新片和参考差多少。下次写稿时,video-script 只在 work_dir 里有这个文件时读它,优先级是:用户指令 > 本片证据 > 参考。数值是参考值,不是硬指标,与你素材里的声音归属、完整台词或表演冲突时,以素材为准。
剪辑节奏那篇按单个剪点取舍;这篇先拿到一组能复核的数字,再逐条决定用不用。
拆片五步:测量、复核、标注、写方法、导出
输入是成片文件,最好加上对它跑出的视频理解结果(建议 5 秒 ASR 窗口);没有也能跑,只是旁白语速为空。视频理解是另一个技能,是否联网看它自己的说明;video-reference 本身只在本地用 ffmpeg 解码。
- measure:一次解码整片,写出切点、镜长分布和响度;成片不变时复用缓存。
- frames 复核:固定阈值在真实成片上两头都会错,所以每次都看待复核窗口(
--review)和最长 5 个镜头(--longest 5)的截帧,把漏切、误报写进cut_fixes;看过无需改动也写{}。 - 标注:声音归属(旁白、原声对白、动作声、环境声、音乐、静音)和叙事段落(钩子、铺垫、转折、升级、兑现);声音边界放在实际开口与停下处,不按字幕。
- 写事实与方法:事实带时间或测量锚点;方法写规则、适用与避免条件、作用于哪份策划文件和证据,数字只引用测量路径,不手写。
- check → export:零 error 才导出;叙事结构、节奏、镜头剪辑、旁白字幕、音画分工五个维度,各至少一条方法,或写明跳过原因。
量到什么,精度到哪一层
| 数值 | 怎么来 |
|---|---|
| 切点与镜长 | ffmpeg 场景分数:≥10 分必算,≥4 分须是前后 0.3 秒内的孤立峰。得出镜长中位数、p10/p90、短于 1 秒与长于 8 秒的占比、每分钟切点和 10 秒窗口曲线。复核过标 reviewed,否则 measured |
| 响度 | 整体响度、响度范围 LRA、真峰值、逐秒短期响度;measured |
| 各声音归属 | 时长、占比、块时长中位数、段内每分钟切点、平均响度;旁白还可按作用(背景、因果、伏笔、解读、过渡)分占比 |
| 各叙事段落 | 时长、每分钟切点、旁白占比,位置按全片比例记 |
| 旁白语速 | 每秒字数,只用旁白覆盖 ≥80% 的 ASR 窗口,是粗窗口精度,不是逐词对齐 |
| 换手对齐 | 声音归属切换落在画面切点 ±0.25 秒内的比例 |
| 第一段原声 | 原声对白(含原片自带画外音)首次出现的位置,导出只留全片比例 |
| 字幕形态 | 是否烧录、最多几行、原声台词的标记 |
后六项来自你的标注(导出的节奏数值标 labeled),只和标注一样准。
测不到的,和不能带走的
测不到、不判断:慢叠化测不到;运动后的暗场硬切、0.3 秒内分数相近的两个切点不会自动算,只进待复核窗口。检查规则不判断语义,方法的方向要你对照派生值来写。数值只说明参考片这样做了,不说明这样好看,也不说明适合你的题材。
不能带走:
- 导出前会拦下原片人名、与台词或资料共有连续 8 个汉字的句子、绝对时间码和路径;它只拦字面泄漏,拦不住改写过的剧情。
U/里的拆解文件和截帧含原片事实与画面,只留本地,不进新项目,也不提交。- 参考片的画面、旁白原文和逐段安排都不进你的片子,也不要逐句改写它的旁白。技能自己的反例之一就是“照着这部片的结构做”:没有条件,无法迁移。
- 参考片要你本地已有;能否获取、分析和使用,由你自己确认。
这与短剧对标片段拆视听的边界一致:迁移做法,不迁移内容。
原创纸面例:拿参考片的节奏对照渡口解说稿
以下全部为本文虚构:参考片 R 是假想的 6 分钟悬疑短片解说,不对应任何真实频道、作品或视频;数值只作示意,没有实际运行、剪辑或试听。
R 导出的两条方法(示意):
- m1|叙事结构,用于故事方案:开场一句旁白交代处境,随后让第一段原声冲突接管。适用:冲突原声能独立听懂;避免:台词要靠大量前情才听得懂。
- m2|音画分工,用于画面声音板:旁白段用较长镜头,原声段保留原片自身的剪辑节奏。避免:靠动作声推进的段落。
我的片子是已获授权的 8 分钟原创短片:末班渡轮开船前,售票员阿澄发现乘客的船票印着明天的日期;争执戏是一个很长的双人镜头。我按自己的分镜表手算草稿数值:
| 项目 | 参考 R(示意)→ 我的草稿(手算) |
|---|---|
| 第一段原声位置 | 0.04 → 约 0.19(开场约 95 秒全是旁白) |
| 旁白占比 | 0.55 → 约 0.72 |
| 旁白段每分钟切点 | 12 → 约 15(缆绳、灯的插镜多) |
| 原声段每分钟切点 | 24 → 约 8(原片长镜头) |
| 旁白语速 | 4.1 字/秒(粗窗口)→ 约 4.6(稿字数 ÷ 计划时长) |
这张表是我手工做的对照,不是技能输出。逐条决定:
- m1 改用:开场旁白删到一句“末班船还剩十分钟,窗口只剩阿澄一个人”,接乘客递票,让她那句“这张票是明天的”提前到约 0.07。不追到 0.04:观众先看见递票,这句原声才听得懂。
- m2 只用一半:旁白段删掉重复插镜,约降到 11;原声段跳过参考的 24——阿澄盖章前的停顿要靠不切来保留,以素材为准。
旁白占比随之降到约 0.62,不再为接近 0.55 继续删;语速等配音后按正常速度听过再定。两条都在 recap_story_plan.json 的可选字段 reference_methods 里记为 adapt,并写明理由。这次只改了两处方案,不证明新稿更好看;R 的段落顺序、旁白和画面都没有进入这份稿。
五种常见误用
- 逐项追平参考值:先问方法的适用条件你的素材满不满足,再看数字。
- 只看全片每分钟切点:全片平均会混掉原声段和旁白段的差别,要看分声音归属、分段落的值。
- 不复核就用镜头数:暗场硬切可能只有 5–7 分,快速运动的单个镜头每 0.2 秒就有一个 7–8 分的峰;重新测量后待复核窗口变了,要按新窗口重看。
- 按字幕定声音边界:按字幕出现帧定的旁白结束点实测晚 0.24–0.42 秒,而换手对齐只容差 ±0.25 秒,边界放错,这个比例只反映标注习惯。
- 把方法写成剧情摘要:带人名、复述发生了什么、写具体时间点的条目都无法迁移,要改写成“什么情况下怎么做”。
常见问题
参考片的段落结构可以直接套到我的稿上吗?
不建议整套套用。写稿在自由创作(CREATE)模式下,可以把参考的结构当作一个候选假设,与素材自己长出的假设比较后再选;按指令写或返修(DIRECTED / REVISION)时默认不套用。即使选中,借用的也只是段落功能和由谁的声音主导,具体内容来自你的素材。
能用 video-reference 比较我的成片和参考片、算出差距吗?
不能。它不打分,不调用任何模型,也不做新片与参考的差距判定;没有脚本读取导出物,它的存在也不改变任何阶段的通过与否。本文的对照表是作者按自己分镜表手算的纸面对照。
没有 ASR 或视频理解结果还能拆吗?
能测切点、镜长和响度,也能标注声音归属和段落。旁白语速会为空,人名泄漏扫描只剩你在事实里写的实体词,检查会给出警告;看画面改用全片每 2 秒取帧的接触表。
用 skill 来做
用 $video-reference 拆我本地提供的这条参考解说成片(以及它的视频理解输出目录,如有)。先 measure,再看待复核窗口和最长镜头的截帧并写 cut_fixes;按声音实际起止标注声音归属与叙事段落,原片事实与可迁移方法分开写,target 只引用测量路径;check 零 error 后再 export 到我下一次制作的 work_dir。不要给参考片或我的片子打分,不做新片与参考的差距判定;导出物里不能有原片人名、台词或时间码,breakdown 与截帧只留本地。