海螺H3三段提示词:画面时间线、声景、配乐

这三个英文段名属于 H3 的结构化提示词格式,不是所有视频模型都通用的“提示词公式”。按以下分工填写:

  1. **integrated_multimodal_description**:从 [Shot 1] 开始,按播放顺序写景别与构图、可见起点、动作变化、说话人、逐字对白、同步发生的声音和可核对的终点。即使只有一个镜头,也写 [Shot 1]。
  2. **overall_soundscape**:用一个连续段落概括全片环境底声、物理动作声和非语言人声,例如雨声、脚步、花盆落桌声或呼吸。不要在这里重复对白。
  3. **non_diegetic_music**:只写角色听不见、观众能听见的配乐,描述乐器、速度、节奏和音量变化。角色能听见的店内收音机或现场演奏仍属于画面时间线。没有观众专属配乐时写 N/A。

声音分层的判断点是“要不要卡在某个动作或发声时刻”:需要精确同步的画内声写在主时间线的对应动作旁;overall_soundscape 汇总全片环境声、物理动作声和非语言人声,必要时可以概括时间线上的重要声响,但不要重复对白。

可复制骨架:

integrated_multimodal_description: [Shot 1] [Style and framing]. [Visible start state]. [Action and visible result; add a timed in-scene sound cue beside its triggering action, if needed]. The [speaker description] (S1) says: <d>[Chinese] 逐字台词</d>. [Visible end state].

overall_soundscape: [Summarize the clip-wide ambience, physical sounds, and non-verbal human sounds; do not repeat dialogue].

non_diegetic_music: N/A

若需要观众专属配乐,把上一示例块最后一行替换为:

non_diegetic_music: [Audience-only score: instruments, tempo, rhythm, and dynamics]

本页沿用 H3 官方英文结构化指南的字段名和示例表达;这是模板格式,不代表英文提示词效果更好,也不代表每个界面都强制要求英文。给说话人一个稳定编号,例如 (S1);身份、音色或动作写在 <d> 外,<d> 内保留语言标签和实际台词。中文对白写成 <d>[Chinese] 原句</d>,逐字保留。详见官方基础与关键帧提示词指南。

以上是提示词结构与阅读示例,不是视频任务请求 JSON。字段名、说话人编号与对白标签要原样保留;页面里的 <d> 是提示词文字,复制后仍要按实际接口放入文本输入。2026-09-30重新核对了上述固定版本官方指南,未在本次编辑中执行视频生成。

首帧、首尾帧与 full-reference 不是同一种格式

先看你实际提交了哪些输入,再选提示词形状。不要先套模板,最后才决定要不要挂参考素材。

输入记录
没有图片,明确做文生视频使用的结构: 三字段; 写作重点: 从文字建立完整的可见起点、动作路径和终点
一张首帧使用的结构: 首帧对齐说明 + 三字段; 写作重点: 从首帧现有姿态、构图和场景继续向前发展
一张首帧 + 一张尾帧使用的结构: 首尾帧对齐说明 + 三字段; 写作重点: 写两帧之间连续、可观察的动作路径;结尾落到尾帧,不再追加新状态
只提供一张尾帧(如果所用入口支持)使用的结构: 尾帧对齐说明 + 三字段; 写作重点: 从合理的先前状态开始,逐步收束到给定尾帧
人物、地点、道具等普通参考图,或参考视频、音频;首帧再加其他参考素材也属于此类使用的结构: full-reference 六段; 写作重点: 定义每项真实素材的标签和作用,再写保留关系与详细时间线

H3 官方指南也定义了仅尾帧的 L2VA:若当前入口提供这种输入,就加尾帧对齐说明并沿三字段写法,从合理前态收束到尾帧;不同界面或接口提供的模式可能不同。

full-reference 的六段依次是:

subject_definitions: ...

summary: ...

retention_analysis: ...

detailed_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

六段是一条完整提示词,不是六次生成,也不能只交其中的 detailed_description。<Picture 1>、<Video 1>、<Audio 1> 等标签必须对应这次任务中实际附加的素材;同类素材的编号要和提交顺序一致。只在文字里写“参考人物图”或 <Picture 1>,不能替代上传或传入那份文件。具体六段规则见官方full-reference 提示词指南。你实际使用的界面或接口未必展示所有模式,应以可用输入方式为准,不要把缺失的参考素材默默改成文生视频。

官方视频生成接口另行区分媒体角色:出现 reference 图片、视频或音频时,不能在同一请求再混入 first_frame / last_frame 角色。如果用已有起始图加人物参考,按 reference 模式提交,在提示词里说明哪张图控制起始构图;写了对齐句也不能替代真实附件。界面未提供的模式不要由这张表臆造。

原创示例:雨后花店里的一片新叶

下面是一个写作示例,不是已测试的 H3 生成结果。设定为文生视频、单镜、固定机位:社区花店的店员在雨后发现一片新叶,把花盆从潮湿窗台移到干燥柜台,并说一句中文对白。

integrated_multimodal_description: [Shot 1] Live-action, a locked medium shot inside a small neighborhood flower shop just after a rain shower. A shop worker in a plain green apron stands beside a rain-speckled front window. A small potted pothos rests on the wet windowsill in front of her. She notices one pale new leaf beneath the larger leaves and leans closer without touching it. She then cups the pot with both hands, lifts it straight up from the wet sill, carries it one step to the dry wooden counter on the right, and sets it down with a soft ceramic tap. Keeping both hands beside the pot, the worker with a clear, gentle voice (S1) looks at the new leaf and says: <d>[Chinese] 你也撑过这场雨了。</d> She ends facing the pot on the dry counter, her gaze still on the new leaf.

overall_soundscape: Rainwater drips at an uneven pace from the awning outside while distant tires pass over the wet street. As the pot is set down, its base makes one light tap on the wooden counter.

non_diegetic_music: N/A

这条提示词只承担一次主要变化:花盆从湿窗台移到干柜台。起点、动作和终点都能在单镜中观察;对白只出现一次,并由 (S1) 绑定到店员。花盆放到柜台时的轻响先写在画面时间线的动作旁,再由 overall_soundscape 简要概括;雨后街声只需写在整体声景。没有观众专属配乐,所以末段明确写 N/A。若你改用首帧或首尾帧,应先实际附加相应图片,再加官方要求的对齐说明,并让正文从首帧出发或准确落到尾帧。

看到这些提示词问题,就按对应字段修改

先检查文字本身,再用实际生成结果验证;以下改法不承诺模型一定执行。

你在草稿中看到的问题具体改法
中文台词被翻译、润色,或 <d> 里混入“轻声说”等表演说明恢复剧本原句与标点;把语言写成 [Chinese],把语气、动作和说话人移到 <d> 外
台词存在,但不知道谁说第一次发声时补足可识别的说话人描述并编号 (S1);后续发声沿用同一编号
需要卡动作点的声音只写进整体声景,或全片声景和对白都塞进主时间线需要同步的画内声写在 integrated_multimodal_description 的对应动作旁;overall_soundscape 概括全片环境/物理/非语言声,可归纳重要声响但不复述对白;观众专属配乐放进 non_diegetic_music
首尾帧已经确定,正文结尾却让人物继续移动或让道具换到第三个位置删除尾帧之后的新动作;把中间过程改成从首帧可见状态连续收束到尾帧状态
正文写了 <Picture 2>、角色参考图或参考音频,但任务里没有那份输入实际附加素材并核对同类素材顺序;如果不再使用它,删除标签并重新选择无图、首帧、首尾帧或 full-reference 结构,不要让文字假装文件已经存在

一次只修正已经定位的字段。若画面问题其实来自分镜终点含糊,先回到剧本转分镜确定终点;若你要处理一般图生视频中的左右手、持物、遮挡和起终点差异,参考图生视频提示词。本页只负责 H3 的结构、对白与声音分层,以及输入模式对应的格式。

常见问题

海螺H3提示词应该写中文还是英文?

本页可复制模板沿用 H3 官方指南的英文字段名和英文示例格式。中文对白不要翻译,按 <d>[Chinese] ...</d> 保留原句。这个说明描述的是模板写法,不代表英文效果更好,也不表示每个入口都强制英文;如果你使用的入口接受其他语言,按其要求填写。

只提供首帧、尾帧或多张参考素材时用哪种结构?

仅首帧用首帧对齐说明加三字段;仅尾帧(当前入口支持时)用 L2VA 尾帧对齐说明加三字段,从合理的先前状态收束到尾帧;首尾帧成对也用对齐说明加三字段。普通参考图、视频或音频用 full-reference 六段。所有素材都要实际提交,标签按同类附件顺序对应。

对白、环境音和配乐分别写在哪里?

对白以及需要卡动作点的画内声写在 integrated_multimodal_description 或 full-reference 的 detailed_description 对应时刻。overall_soundscape 汇总全片环境声、物理动作声和非语言人声,可简要归纳重要声响,但不要重复对白。只有观众听见的配乐写入 non_diegetic_music;角色听得见的收音机、现场演奏或歌声留在画面时间线。

用 skill 来做

准备好已确认的单镜分镜、逐字对白,以及这次实际会提交的首帧、尾帧或参考素材,然后用 /short-drama-video-prompts(Codex 用 $short-drama-video-prompts)并明确写“按 MiniMax H3 格式”。它会按实际输入选择三字段或 full-reference 六段,并输出可复制的提示词;这一步不替你上传素材,也不执行视频生成。

查看具体方法: H3格式、输入模式与声音分层

了解 Drama Skills在 GitHub 查看 short-drama-video-prompts

全部指南