August 12

MiniMax H3 对话与时序提示词指南

一份实用的 MiniMax H3 提示词指南,帮助控制对话、说话人归属、镜头时序、声音和产品一致性,并附真实 A/B 视频测试。

MiniMax H3 提示词指南:控制对话、剪辑与时序

这份 MiniMax H3 提示词指南 将展示如何控制说话人、口型同步、剪辑、声音和产品一致性,而不是依赖画面好看却含糊不清的场景描述。

一个来自 MiniMax H3 社区的示例,展示了引导式对话、动作、清晰可读的道具、镜头运动和定时反应镜头。

开场片段来自 Reddit 用户 GrayingGamer 分享的结构化提示词。它指示了两位说话人、多个动作、清晰可读的道具、镜头运动、声音,以及大约在第十秒出现的反应镜头。商业项目应使用获得授权的角色、声音、产品和品牌资产。其有价值的经验在于采用了拍摄脚本逻辑。

为什么 MiniMax H3 提示词指南很重要

简短提示词可用于单一主体和单一动作。当涉及多位说话人、画外音、多个镜头或定时产品动作时,结构就变得很有用。否则,正确的声音可能播放出来,但错误的角色却在动嘴。剪辑可能过早出现,产品也可能在镜头之间发生变化。

实用的 MiniMax H3 提示词指南 应减少这种歧义。再多的风格形容词,也无法替代清晰的说话人身份或时间线。

选择正确的官方 MiniMax H3 提示词指南

MiniMax 提供两项官方资源:

官方资源最适合主要结构
视频提示词编写指南文生视频、图生视频、首尾帧和尾帧任务integrated_multimodal_descriptionoverall_soundscapenon_diegetic_music
全参考模式指南使用独立主体、图像、视频、动作或音频参考的任务subject_definitionsnon_diegetic_music 的六个部分

视频提示词编写指南

Top of the official MiniMax H3 Video Prompt Writing Guide

全参考模式指南

Top of the official MiniMax H3 Full-Reference Mode Guide

对于文本或帧驱动生成,请使用第一份 MiniMax H3 提示词指南。当图像定义产品、视频控制运动或音频控制语音表达时,请使用全参考指南。

当前官方语法为说话人提供了稳定的 ID,例如 (S1)(S2)。说话人身份和表达方式应置于 <d> 之外。只有语言和说出的内容应放在其中:

声音清晰、自信的女主持人 (S1) 问道:
<d>[English] Ready for the pressure test?</d>

对于画外台词,请将其标识为画外旁白,并说明画面中角色的嘴唇保持闭合。

可控时间线的四条规则

  1. 分配说话人和静默角色。 每个声音只介绍一次,在不同镜头中保持相同 ID,并标识哪些人不得说话。
  2. 将剪辑点放在时间线上。 从不带时间戳的 [Shot 1] 开始。为后续镜头设置递增的剪辑时间:
[Shot 1] 中景建立主持人、技术员和测试水箱的画面。
[Shot 2] At 00:04.000, 镜头切换至手表特写。
[Shot 3] At 00:08.000, 镜头切换至技术员举起手表的画面。
  1. 分离语音和声音。 将对话放在 <d> 中,将物理声音放在 overall_soundscape 中,将仅供观众听到的音乐放在 non_diegetic_music 中。
  2. 使脚本匹配输出时长。 如果对话重叠或产品动作进行得太快,请缩短脚本或延长片段。

这份 MiniMax H3 提示词指南 不仅控制剪辑,也控制节奏。时间戳之间的间隔,就是每项动作和台词可使用的时间。

MiniMax H3 提示词测试:简短版与结构化版

我们针对一个手表压力测试概念,测试了两种提示词风格。它要求三个镜头、两个人、三句台词、一句男性画外台词、两次剪辑,以及一只保持一致的潜水表。这项 MiniMax H3 提示词指南 对比是一项实际演示,而非正式基准测试。

主要提示词差异如下:

控制项简短提示词结构化提示词
说话人在段落中按角色描述固定为 (S1)(S2)
画外台词“技术员在画外说话”明确的画外旁白加闭嘴指令
剪辑以普通时间指示的方式书写写作 [Shot 2] At 00:04.000[Shot 3] At 00:08.000
声音笼统要求真实声音分别置于 overall_soundscapenon_diegetic_music

测试 1:简短提示词

简短版本创建了令人信服的工作室场景,并让手表保持可辨识性。然而,在技术员的画外台词期间,女主持人明显动嘴,仿佛在用他的声音说话。其剪辑大约出现在 3.54 秒和 6.79 秒,因此最终展示过早开始。

测试 2:结构化 MiniMax H3 提示词指南格式

结构化的 MiniMax H3 提示词指南 版本使用了说话人 ID、画外旁白、闭嘴指令和定时镜头。其剪辑大约出现在 3.92 秒和 7.88 秒,接近要求的四秒和八秒时间点。

没有出现明显的错误口型同步。手表占据前景,主持人则留在背景中。她的嘴部部分被遮挡,因此这并不能证明执行完美无误。不过,结构化的 MiniMax H3 提示词指南 避免了测试 1 中明显的不匹配问题。

结果简短提示词结构化提示词
说话人归属男声配合可见的女性嘴部动作没有明显的错误人物口型同步
剪辑时序约 3.54 秒和 6.79 秒约 3.92 秒和 7.88 秒
产品一致性手表保持可辨识性手表保持可辨识性,且特写更突出
遗留问题可见的说话人不匹配技术员衬衫上出现轻微伪文字
简短提示词在 4.5 秒时的画面结构化提示词在 4.5 秒时的画面
The female host visibly lip-syncs to the male off-screen voice in the brief prompt resultThe structured prompt result avoids an obvious wrong-person lip-sync during the male off-screen line

在 4.5 秒时,简短版本显示画面中可见的主持人随着技术员的画外声音动嘴。结构化版本避免了同样明显的不匹配。

两个片段看起来都具有商业可用的可信度。这项 MiniMax H3 提示词指南 测试并不表明更长的提示词总能生成更漂亮的画面。它说明,正确的结构可以提升控制力。

可复用的 MiniMax H3 提示词指南模板

integrated_multimodal_description:
[Shot 1] 风格、构图、产品、说话人 (S1)、动作和对话。
[Shot 2] At 00:SS.mmm, 新构图、产品动作、说话人 (S2)、
画外或画内表达、准确对话,以及谁保持静默。
[Shot 3] At 00:SS.mmm, 最终动作、产品一致性和结束画面。

overall_soundscape: 按播放顺序排列的环境声和物理声音。
non_diegetic_music: 仅供观众听到的配乐,或 N/A。

对于参考模式,请改为遵循第二份官方 MiniMax H3 提示词指南。在编写时间线之前,先定义每个 <Subject N><Picture N><Video N><Audio N> 所控制的内容。

商业质量检查清单

在批准电商或社交视频前,请检查:

  • 每句台词均由预定说话人发出,静默角色不会产生错误口型同步。
  • 剪辑发生在接近要求的时间点,并为对话和产品动作留出充足空间。
  • 产品的颜色、结构、标志、纹理和比例保持稳定。
  • 手部、面部、反射、阴影、接触点和可见文字均通过审核。
  • 构图适合目标产品详情页、平台商品列表、Reel、TikTok 或广告。

将提示词转化为 WeShop AI 工作流

在 WeShop AI 中打开 MiniMax H3 工作流,并选择适合您资产的输入模式。使用文本从零开始构建,使用首帧锁定开场构图,或者在独立资产控制产品身份、动作或声音时使用全参考模式。

然后遵循以下五个步骤:

  1. 定义交付内容和时长。
  2. 分配说话人、参考资料和锁定的产品细节。
  3. 编写符合实际的 MiniMax H3 提示词指南 时间线。
  4. 生成一个草稿,并检查控制失败问题。
  5. 仅在基础视频通过审核后再创建营销活动变体。

对于对话广告、演示、讲解视频和多角色视频,这份 MiniMax H3 提示词指南 的经验很简单:更多细节不会自动产生更漂亮的视频。正确的细节会带来更可控的视频。

编辑说明:发布任何第三方素材、角色肖像或声音参考前,请确认已获得许可。