先说清:拆参考片是为下一条片攒方法和数值

video-reference 是按需使用的拆片技能,不在默认生产路径上。它把一部已完成的成片拆成两层:这条片怎么做的(事实),换一份素材还能怎么用(方法)。事实只留在本地,导出的 production_reference.json 只含方法和测得的数值。

它不调用 MiMo 或任何 LLM,不打分,也不判断你的新片和参考差多少。下次写稿时,video-script 只在 work_dir 里有这个文件时读它,优先级是:用户指令 > 本片证据 > 参考。数值是参考值,不是硬指标,与你素材里的声音归属、完整台词或表演冲突时,以素材为准。

剪辑节奏那篇按单个剪点取舍;这篇先拿到一组能复核的数字,再逐条决定用不用。

拆片五步:测量、复核、标注、写方法、导出

输入是成片文件,最好加上对它跑出的视频理解结果(建议 5 秒 ASR 窗口);没有也能跑,只是旁白语速为空。视频理解是另一个技能,是否联网看它自己的说明;video-reference 本身只在本地用 ffmpeg 解码。

  1. measure:一次解码整片,写出切点、镜长分布和响度;成片不变时复用缓存。
  2. frames 复核:固定阈值在真实成片上两头都会错,所以每次都看待复核窗口(--review)和最长 5 个镜头(--longest 5)的截帧,把漏切、误报写进 cut_fixes;看过无需改动也写 {}。
  3. 标注:声音归属(旁白、原声对白、动作声、环境声、音乐、静音)和叙事段落(钩子、铺垫、转折、升级、兑现);声音边界放在实际开口与停下处,不按字幕。
  4. 写事实与方法:事实带时间或测量锚点;方法写规则、适用与避免条件、作用于哪份策划文件和证据,数字只引用测量路径,不手写。
  5. check → export:零 error 才导出;叙事结构、节奏、镜头剪辑、旁白字幕、音画分工五个维度,各至少一条方法,或写明跳过原因。

量到什么,精度到哪一层

数值怎么来
切点与镜长ffmpeg 场景分数:≥10 分必算,≥4 分须是前后 0.3 秒内的孤立峰。得出镜长中位数、p10/p90、短于 1 秒与长于 8 秒的占比、每分钟切点和 10 秒窗口曲线。复核过标 reviewed,否则 measured
响度整体响度、响度范围 LRA、真峰值、逐秒短期响度;measured
各声音归属时长、占比、块时长中位数、段内每分钟切点、平均响度;旁白还可按作用(背景、因果、伏笔、解读、过渡)分占比
各叙事段落时长、每分钟切点、旁白占比,位置按全片比例记
旁白语速每秒字数,只用旁白覆盖 ≥80% 的 ASR 窗口,是粗窗口精度,不是逐词对齐
换手对齐声音归属切换落在画面切点 ±0.25 秒内的比例
第一段原声原声对白(含原片自带画外音)首次出现的位置,导出只留全片比例
字幕形态是否烧录、最多几行、原声台词的标记

后六项来自你的标注(导出的节奏数值标 labeled),只和标注一样准。

测不到的,和不能带走的

测不到、不判断:慢叠化测不到;运动后的暗场硬切、0.3 秒内分数相近的两个切点不会自动算,只进待复核窗口。检查规则不判断语义,方法的方向要你对照派生值来写。数值只说明参考片这样做了,不说明这样好看,也不说明适合你的题材。

不能带走:

  • 导出前会拦下原片人名、与台词或资料共有连续 8 个汉字的句子、绝对时间码和路径;它只拦字面泄漏,拦不住改写过的剧情。
  • U/ 里的拆解文件和截帧含原片事实与画面,只留本地,不进新项目,也不提交。
  • 参考片的画面、旁白原文和逐段安排都不进你的片子,也不要逐句改写它的旁白。技能自己的反例之一就是“照着这部片的结构做”:没有条件,无法迁移。
  • 参考片要你本地已有;能否获取、分析和使用,由你自己确认。

这与短剧对标片段拆视听的边界一致:迁移做法,不迁移内容。

原创纸面例:拿参考片的节奏对照渡口解说稿

以下全部为本文虚构:参考片 R 是假想的 6 分钟悬疑短片解说,不对应任何真实频道、作品或视频;数值只作示意,没有实际运行、剪辑或试听。

R 导出的两条方法(示意):

  • m1|叙事结构,用于故事方案:开场一句旁白交代处境,随后让第一段原声冲突接管。适用:冲突原声能独立听懂;避免:台词要靠大量前情才听得懂。
  • m2|音画分工,用于画面声音板:旁白段用较长镜头,原声段保留原片自身的剪辑节奏。避免:靠动作声推进的段落。

我的片子是已获授权的 8 分钟原创短片:末班渡轮开船前,售票员阿澄发现乘客的船票印着明天的日期;争执戏是一个很长的双人镜头。我按自己的分镜表手算草稿数值:

项目参考 R(示意)→ 我的草稿(手算)
第一段原声位置0.04 → 约 0.19(开场约 95 秒全是旁白)
旁白占比0.55 → 约 0.72
旁白段每分钟切点12 → 约 15(缆绳、灯的插镜多)
原声段每分钟切点24 → 约 8(原片长镜头)
旁白语速4.1 字/秒(粗窗口)→ 约 4.6(稿字数 ÷ 计划时长)

这张表是我手工做的对照,不是技能输出。逐条决定:

  1. m1 改用:开场旁白删到一句“末班船还剩十分钟,窗口只剩阿澄一个人”,接乘客递票,让她那句“这张票是明天的”提前到约 0.07。不追到 0.04:观众先看见递票,这句原声才听得懂。
  2. m2 只用一半:旁白段删掉重复插镜,约降到 11;原声段跳过参考的 24——阿澄盖章前的停顿要靠不切来保留,以素材为准。

旁白占比随之降到约 0.62,不再为接近 0.55 继续删;语速等配音后按正常速度听过再定。两条都在 recap_story_plan.json 的可选字段 reference_methods 里记为 adapt,并写明理由。这次只改了两处方案,不证明新稿更好看;R 的段落顺序、旁白和画面都没有进入这份稿。

五种常见误用

  • 逐项追平参考值:先问方法的适用条件你的素材满不满足,再看数字。
  • 只看全片每分钟切点:全片平均会混掉原声段和旁白段的差别,要看分声音归属、分段落的值。
  • 不复核就用镜头数:暗场硬切可能只有 5–7 分,快速运动的单个镜头每 0.2 秒就有一个 7–8 分的峰;重新测量后待复核窗口变了,要按新窗口重看。
  • 按字幕定声音边界:按字幕出现帧定的旁白结束点实测晚 0.24–0.42 秒,而换手对齐只容差 ±0.25 秒,边界放错,这个比例只反映标注习惯。
  • 把方法写成剧情摘要:带人名、复述发生了什么、写具体时间点的条目都无法迁移,要改写成“什么情况下怎么做”。

常见问题

参考片的段落结构可以直接套到我的稿上吗?

不建议整套套用。写稿在自由创作(CREATE)模式下,可以把参考的结构当作一个候选假设,与素材自己长出的假设比较后再选;按指令写或返修(DIRECTED / REVISION)时默认不套用。即使选中,借用的也只是段落功能和由谁的声音主导,具体内容来自你的素材。

能用 video-reference 比较我的成片和参考片、算出差距吗?

不能。它不打分,不调用任何模型,也不做新片与参考的差距判定;没有脚本读取导出物,它的存在也不改变任何阶段的通过与否。本文的对照表是作者按自己分镜表手算的纸面对照。

没有 ASR 或视频理解结果还能拆吗?

能测切点、镜长和响度,也能标注声音归属和段落。旁白语速会为空,人名泄漏扫描只剩你在事实里写的实体词,检查会给出警告;看画面改用全片每 2 秒取帧的接触表。

用 skill 来做

用 $video-reference 拆我本地提供的这条参考解说成片(以及它的视频理解输出目录,如有)。先 measure,再看待复核窗口和最长镜头的截帧并写 cut_fixes;按声音实际起止标注声音归属与叙事段落,原片事实与可迁移方法分开写,target 只引用测量路径;check 零 error 后再 export 到我下一次制作的 work_dir。不要给参考片或我的片子打分,不做新片与参考的差距判定;导出物里不能有原片人名、台词或时间码,breakdown 与截帧只留本地。

更多方法依据: 写稿阶段读取参考的优先级与 reference_methods 记录

安装并使用 Video Recap Skills

全部指南