MiniMax H3 对话与时序提示词指南
一份实用的 MiniMax H3 提示词指南,帮助控制对话、说话人归属、镜头时序、声音和产品一致性,并附真实 A/B 视频测试。
MiniMax H3 提示词指南:控制对话、剪辑与时序
这份 MiniMax H3 提示词指南 将展示如何控制说话人、口型同步、剪辑、声音和产品一致性,而不是依赖画面好看却含糊不清的场景描述。
一个来自 MiniMax H3 社区的示例,展示了引导式对话、动作、清晰可读的道具、镜头运动和定时反应镜头。
开场片段来自 Reddit 用户 GrayingGamer 分享的结构化提示词。它指示了两位说话人、多个动作、清晰可读的道具、镜头运动、声音,以及大约在第十秒出现的反应镜头。商业项目应使用获得授权的角色、声音、产品和品牌资产。其有价值的经验在于采用了拍摄脚本逻辑。
为什么 MiniMax H3 提示词指南很重要
简短提示词可用于单一主体和单一动作。当涉及多位说话人、画外音、多个镜头或定时产品动作时,结构就变得很有用。否则,正确的声音可能播放出来,但错误的角色却在动嘴。剪辑可能过早出现,产品也可能在镜头之间发生变化。
实用的 MiniMax H3 提示词指南 应减少这种歧义。再多的风格形容词,也无法替代清晰的说话人身份或时间线。
选择正确的官方 MiniMax H3 提示词指南
MiniMax 提供两项官方资源:
| 官方资源 | 最适合 | 主要结构 |
|---|---|---|
| 视频提示词编写指南 | 文生视频、图生视频、首尾帧和尾帧任务 | integrated_multimodal_description、overall_soundscape、non_diegetic_music |
| 全参考模式指南 | 使用独立主体、图像、视频、动作或音频参考的任务 | 从 subject_definitions 到 non_diegetic_music 的六个部分 |
视频提示词编写指南

全参考模式指南

对于文本或帧驱动生成,请使用第一份 MiniMax H3 提示词指南。当图像定义产品、视频控制运动或音频控制语音表达时,请使用全参考指南。
当前官方语法为说话人提供了稳定的 ID,例如 (S1) 和 (S2)。说话人身份和表达方式应置于 <d> 之外。只有语言和说出的内容应放在其中:
声音清晰、自信的女主持人 (S1) 问道:
<d>[English] Ready for the pressure test?</d>
对于画外台词,请将其标识为画外旁白,并说明画面中角色的嘴唇保持闭合。
可控时间线的四条规则
- 分配说话人和静默角色。 每个声音只介绍一次,在不同镜头中保持相同 ID,并标识哪些人不得说话。
- 将剪辑点放在时间线上。 从不带时间戳的
[Shot 1]开始。为后续镜头设置递增的剪辑时间:
[Shot 1] 中景建立主持人、技术员和测试水箱的画面。
[Shot 2] At 00:04.000, 镜头切换至手表特写。
[Shot 3] At 00:08.000, 镜头切换至技术员举起手表的画面。
- 分离语音和声音。 将对话放在
<d>中,将物理声音放在overall_soundscape中,将仅供观众听到的音乐放在non_diegetic_music中。 - 使脚本匹配输出时长。 如果对话重叠或产品动作进行得太快,请缩短脚本或延长片段。
这份 MiniMax H3 提示词指南 不仅控制剪辑,也控制节奏。时间戳之间的间隔,就是每项动作和台词可使用的时间。
MiniMax H3 提示词测试:简短版与结构化版
我们针对一个手表压力测试概念,测试了两种提示词风格。它要求三个镜头、两个人、三句台词、一句男性画外台词、两次剪辑,以及一只保持一致的潜水表。这项 MiniMax H3 提示词指南 对比是一项实际演示,而非正式基准测试。
主要提示词差异如下:
| 控制项 | 简短提示词 | 结构化提示词 |
|---|---|---|
| 说话人 | 在段落中按角色描述 | 固定为 (S1) 和 (S2) |
| 画外台词 | “技术员在画外说话” | 明确的画外旁白加闭嘴指令 |
| 剪辑 | 以普通时间指示的方式书写 | 写作 [Shot 2] At 00:04.000 和 [Shot 3] At 00:08.000 |
| 声音 | 笼统要求真实声音 | 分别置于 overall_soundscape 和 non_diegetic_music 中 |
测试 1:简短提示词
简短版本创建了令人信服的工作室场景,并让手表保持可辨识性。然而,在技术员的画外台词期间,女主持人明显动嘴,仿佛在用他的声音说话。其剪辑大约出现在 3.54 秒和 6.79 秒,因此最终展示过早开始。
测试 2:结构化 MiniMax H3 提示词指南格式
结构化的 MiniMax H3 提示词指南 版本使用了说话人 ID、画外旁白、闭嘴指令和定时镜头。其剪辑大约出现在 3.92 秒和 7.88 秒,接近要求的四秒和八秒时间点。
没有出现明显的错误口型同步。手表占据前景,主持人则留在背景中。她的嘴部部分被遮挡,因此这并不能证明执行完美无误。不过,结构化的 MiniMax H3 提示词指南 避免了测试 1 中明显的不匹配问题。
| 结果 | 简短提示词 | 结构化提示词 |
|---|---|---|
| 说话人归属 | 男声配合可见的女性嘴部动作 | 没有明显的错误人物口型同步 |
| 剪辑时序 | 约 3.54 秒和 6.79 秒 | 约 3.92 秒和 7.88 秒 |
| 产品一致性 | 手表保持可辨识性 | 手表保持可辨识性,且特写更突出 |
| 遗留问题 | 可见的说话人不匹配 | 技术员衬衫上出现轻微伪文字 |
| 简短提示词在 4.5 秒时的画面 | 结构化提示词在 4.5 秒时的画面 |
|---|---|
![]() | ![]() |
在 4.5 秒时,简短版本显示画面中可见的主持人随着技术员的画外声音动嘴。结构化版本避免了同样明显的不匹配。
两个片段看起来都具有商业可用的可信度。这项 MiniMax H3 提示词指南 测试并不表明更长的提示词总能生成更漂亮的画面。它说明,正确的结构可以提升控制力。
可复用的 MiniMax H3 提示词指南模板
integrated_multimodal_description:
[Shot 1] 风格、构图、产品、说话人 (S1)、动作和对话。
[Shot 2] At 00:SS.mmm, 新构图、产品动作、说话人 (S2)、
画外或画内表达、准确对话,以及谁保持静默。
[Shot 3] At 00:SS.mmm, 最终动作、产品一致性和结束画面。
overall_soundscape: 按播放顺序排列的环境声和物理声音。
non_diegetic_music: 仅供观众听到的配乐,或 N/A。
对于参考模式,请改为遵循第二份官方 MiniMax H3 提示词指南。在编写时间线之前,先定义每个 <Subject N>、<Picture N>、<Video N> 或 <Audio N> 所控制的内容。
商业质量检查清单
在批准电商或社交视频前,请检查:
- 每句台词均由预定说话人发出,静默角色不会产生错误口型同步。
- 剪辑发生在接近要求的时间点,并为对话和产品动作留出充足空间。
- 产品的颜色、结构、标志、纹理和比例保持稳定。
- 手部、面部、反射、阴影、接触点和可见文字均通过审核。
- 构图适合目标产品详情页、平台商品列表、Reel、TikTok 或广告。
将提示词转化为 WeShop AI 工作流
在 WeShop AI 中打开 MiniMax H3 工作流,并选择适合您资产的输入模式。使用文本从零开始构建,使用首帧锁定开场构图,或者在独立资产控制产品身份、动作或声音时使用全参考模式。
然后遵循以下五个步骤:
- 定义交付内容和时长。
- 分配说话人、参考资料和锁定的产品细节。
- 编写符合实际的 MiniMax H3 提示词指南 时间线。
- 生成一个草稿,并检查控制失败问题。
- 仅在基础视频通过审核后再创建营销活动变体。
对于对话广告、演示、讲解视频和多角色视频,这份 MiniMax H3 提示词指南 的经验很简单:更多细节不会自动产生更漂亮的视频。正确的细节会带来更可控的视频。
编辑说明:发布任何第三方素材、角色肖像或声音参考前,请确认已获得许可。

