August 11

MiniMax H3 提示词指南:公式、分镜、模板与常见错误

了解如何为 MiniMax H3 编写提示词,涵盖多模态参考、图生视频、文生视频、分镜、对话、声音和屏幕文字。

有效的 AI 视频提示词不需要几十个形容词,也不需要采用专业电影剧本的格式。它需要回答三个实际问题:

  1. 每个参考素材分别起什么作用?
  2. 视频的核心创意是什么?
  3. 画面和声音应如何随时间推进?

当在 MiniMax H3 中使用文本、图像、视频和音频参考时,你可以使用一个简单公式来组织这些指令:

完整提示词 = 参考素材说明 + 核心概念 + 视觉序列

对于需要更强连续性、产品还原度或复杂镜头运动的项目,可在最后添加一致性要求和排除项。

第 1 部分:定义每个参考素材的角色

上传参考文件后,首先说明每个素材应控制哪些内容。不要假设模型会自动识别它们之间的预期关系。

常见的参考角色包括:

  • 角色参考: 定义面部、发型、服装和整体外观。
  • 物体参考: 定义产品或道具。
  • 场景参考: 定义环境、空间布局和灯光。
  • 首帧或尾帧: 确定视频应如何开始或结束。
  • 风格参考: 指导颜色、纹理和视觉语言。
  • 构图参考: 指导主体位置和视觉关系。
  • 动作参考: 为人物或物体提供动作。
  • 镜头参考: 提供镜头运动模式。
  • 声音参考: 指导角色的声音。
  • 音频复用: 使用上传音轨的全部或部分内容。
  • 视频编辑参考: 指明在现有视频中需添加、移除或修改的元素。

参考素材说明块可以这样写:

@Image1 提供女主角的面部、发型和服装。
@Image2 提供黑暗城堡与清晨逆光。
@Video1 提供舞蹈动作。
@Audio1 提供音乐节奏和整体氛围。

如果某项特征必须保持一致,请直接说明这一要求:

保持 @Image1 中角色的面部特征、银色发型和白色刺绣服装一致。

第 2 部分:定义视频核心概念

核心概念应以一句话概括整个视频。至少应包括:

  1. 主体: 出现的人或物。
  2. 地点: 场景发生的位置。
  3. 事件: 主体执行的动作。
  4. 形式与风格: 广告、电影、动画、纪录片或其他处理方式。
  5. 镜头规则: 单个连续镜头、快速剪辑、航拍或其他方式。

例如:

一位外观遵循 @Image1 的年轻女性,在 @Image2 的樱花庭院中表演 @Video1 的剑舞动作。
使用写实电影感的中国古装风格,并以一个连续镜头呈现该段画面。

保持这段陈述简洁。如果核心创意包含多个互不相关的角色、地点或故事线,即使提供详细的镜头说明,也可能难以让结果保持连贯。

第 3 部分:描述视觉序列

你可以按时间范围或镜头来组织视觉序列。每个片段都应说明关键元素:

  • 镜头景别;
  • 主体与动作;
  • 镜头运动;
  • 对话或旁白;
  • 环境音、音乐和关键音效;
  • 必须出现的屏幕文字;
  • 不应出现的元素。

例如:

0–3 秒:全景。女子从左侧走入樱花庭院。
背景轻微虚化。仅使用脚步声和风吹树叶的声音。
无对白。

3–8 秒:切换至中景。她拔出剑并摆出起始姿势,
遵循 @Video1 中的动作。樱花飘落时,镜头缓慢向前推进。

8–12 秒:特写。剑光闪过,动作放慢,剑刃将
飘落的花瓣推向两侧。

12–15 秒:回到全景。她完成整段动作,放下剑,
并望向镜头。
非叙事内音乐:不适用。不要添加背景音乐。

这种结构可清晰建立动作、镜头运动和声音之间的关系,也让单独修改各个镜头更加容易。

三种生成模式下如何编写 MiniMax H3 提示词

1. 多模态参考生成

当你同时上传角色、动作、场景和音频参考时,请为每个文件指定明确职责。

@Image1 是角色参考。保持女主角的面部和服装一致。
@Image2 是背景参考。
@Video1 是动作参考。使用剑舞动作。
@Audio1 是音乐和情绪参考。
展示女主角在清晨的黑暗城堡中表演参考动作。
让剪辑点与音乐中的主要节拍同步。

避免上传参考素材却不说明其使用方式。视频可同时包含人物动作、镜头运动、剪辑和声音,因此应明确哪些元素对结果最重要。

20260811_1_fb52dea0-3c41-4a77-809b-152a480584ae_1255x294.png

screenshot-20260811-102227.png Clipboard_Screenshot_1785318067.png

2. 图生视频提示词

使用一张图像时,应说明它是首帧、角色参考,还是通用视觉参考。使用两张图像时,应定义起始帧和结束帧之间的关系。

@Image1 是首帧:一名女子手持长剑站在樱花树下。
让她从起始姿势运动至剑舞序列结束。
使用一个无剪辑的连续镜头。
保持角色、服装和庭院构图一致。

首尾帧工作流主要需要说明连接两帧的动作、灯光和声音。如需额外剪辑,请明确提出。 screenshot-20260811-122439.png

任务-66803765-1-4.png

3. 文生视频提示词

没有参考素材时,应更详细地描述主体、环境、动作、视觉风格、镜头和声音。

15 秒,16:9,写实自然纪录片风格。
黎明时分的薄雾湿地中,一只成年白鹤单脚站在浅水里,
缓慢将头转向镜头。
柔和逆光穿过薄雾,水面上泛起细小涟漪。
镜头从超广角全景缓慢推进至中景,全程不切镜。
仅使用风声、水声和远处鸟鸣。不要添加背景音乐。

相比“生成一只站在水中的鹤”,此版本定义了时长、画幅比例、主体、环境、灯光、动作、镜头方向和声音。 screenshot-20260811-124118.png

应如何拆分镜头?

使用剪辑点,而不是每秒加入一个新动作

MiniMax H3 提示词可以围绕镜头和剪辑点组织。在每个镜头内,保持一个主要动作。切镜后,必要时重新说明主体、景别和空间关系。

不必每秒引入不同动作。过于密集的指令可能会相互冲突,并掩盖主要事件。

使对话长度与镜头时长匹配

一个三秒镜头无法自然容纳很长的一句台词。将对话分配给镜头前,先大声读出来并估算其时长。

对于跨越剪辑点的对话,可描述 J-cut 或 L-cut:

  • J-cut: 下一个镜头的音频在画面切换前开始。
  • L-cut: 上一个镜头的音频在画面变化后继续。

示例:

镜头 1:画外音说道:“醒醒,醒醒。”

镜头 2:切换至一名中年女性的特写。她是上一镜头的说话者,
并继续说道:“该去上学了。”

不要将连续镜头与多镜头结构混用

如果要求一个连续镜头,就应描述同一连续空间内的运动。不要同时要求多个镜头、硬切或地点之间的突然跳转。

如果视频需要多个场景,请删除连续镜头指令,并清晰定义每一个剪辑点。

如何控制声音和屏幕文字

分离不同类型的声音

将声音视为多个不同层次:

  • 角色对白;
  • 旁白;
  • 环境音;
  • 动作音效;
  • 非叙事内音乐。

如果不需要背景音乐,请写:

非叙事内音乐:不适用。
不要添加背景音乐。

避免一边要求模型复用音乐,一边又要求没有背景音乐。如果想保留环境音但移除音乐,应明确区分两者。

写出准确的屏幕文字

如果视频需要标题、标志、标语或按钮,请提供确切文案:

手机屏幕上的标题为:“AI 视频创作”。
按钮文字为:“立即开始”。

你还可以控制位置、出现频率和动画效果:

标题仅在画面中央显示一次。
淡入,停留两秒,不要重复出现。

请务必手动检查生成的文字、标志和界面元素。AI 生成视频可能会拼写错误、变形、重复或更改这些细节。

用可见动作替换隐喻

“孤独如潮水般涌起”表达了一种情绪,但它并未定义一个可见场景。

应将这种感受转化为动作、构图、灯光、空间和声音:

一个人独自站在空荡的铁路站台中央。
镜头缓慢后拉。远处驶离列车的灯光逐渐消失,
只留下雨声和车站广播的回响。

具体的视觉指令通常比抽象的情绪语言更具可控性。

MiniMax H3 提示词的常见错误及修正方法

常见错误推荐修正方法
将所有内容写成一个大段落将参考素材、核心概念和镜头序列分开
上传素材却未定义用途为每个文件分配角色、动作、场景、构图或声音职责
包含相互矛盾的指令删除冲突的镜头、声音或风格要求
要求一个连续镜头和多次剪辑将序列改写为连续运动,或删除连续镜头规则
没有参考图却期待同一张脸上传角色图像并指定需要保留的特征
文生视频提示词过短添加主体、环境、动作、镜头、灯光和声音
仅使用抽象风格语言将其转化为可见的颜色、纹理、灯光和构图
在短镜头中塞入过多对白缩短台词或增加镜头时长
同时要求保留和移除音乐分别说明环境音、音效和非叙事内音乐
为多个参考素材赋予重叠职责定义每个素材的主要角色

可直接复制的 MiniMax H3 提示词模板

[参考素材说明]
@Image1:角色参考。保持 ________ 一致。
@Image2:产品/场景参考。保持 ________ 一致。
@Video1:动作/镜头/剪辑参考。使用 ________。
@Audio1:声音/音乐/节奏参考。使用 ________。

[核心概念]
时长:____ 秒。画幅比例:____。
主体 ________ 在 ________ 中执行 ________。
使用 ________ 视觉风格和 ________ 镜头规则。

[视觉序列]
0–__ 秒:景别 ________;画面 ________;动作 ________;
镜头运动 ________;声音 ________。

__–__ 秒:景别 ________;画面 ________;动作 ________;
镜头运动 ________;声音 ________。

__–__ 秒:景别 ________;画面 ________;动作 ________;
镜头运动 ________;声音 ________。

[文字和声音]
必需屏幕文字:“________。”
角色 ________ 说道:“________。”
环境音:________。
非叙事内音乐:________。

[一致性要求和排除项]
保持 ________ 一致。
不要包含 ________。
pasted-1785391007599.png 迷你马克斯.png 纯净场景.png
【参考素材指南】
@Image 3:场景视觉风格——街道 / 夜晚 / 地下空间、幽闭构图、环境纵深、胶片颗粒。
@Image 2:字体与平面包装——字体纹理、平面设计、动态字体、强烈动态图形冲击力。
@Image 1:角色外观——面部、发型、服装轮廓、身体比例、态度和整体氛围。

仅参考指定维度。不要直接复制参考图像。不得包含原始参考图像中的现实品牌、标志、标题或可识别文字。

【核心概念】
一支 10 秒、16:9 横版 Trap 音乐视频。两位飞探兄弟直接面向镜头表演,在多个紧凑的地下场景中轮流说唱。整支视频随 Trap 节拍律动,使用与节拍同步的硬切。每次低音击打时,高对比度、印刷海报风格的英文粗体字都会猛然冲入屏幕。

整体美学:地下音乐录像带 + 时尚杂志拼贴 + 高级时装编辑品质,呈现冷峻、克制的兄弟双人表演。

【视觉序列说明】

镜头 1 —— 极致面部特写 / 幽闭通道

* 场景:狭窄走廊或地下入口,近距离拍摄,参考 @Image 3。
* 构图:面部极致特写——脸部 / 眼睛 / 颈部与肩膀 / 部分衣领细节。
* 角色:侦探 A 直视镜头开始说唱,表情冷静却锋利。
* 字体:“TWO FLY”巨型粗体英文文字从画面顶部和底部压入,不遮挡眼睛。
* 节奏:在 808 低音击打时,“TWO FLY”立即垂直压缩,随后弹回。踩镲滚奏期间,字母边缘以细碎动作快速振动。在重读单词“fly”时,触发扫描线错位/故障效果。
* 硬切。

镜头 2 —— 中近景 / 字体墙背景

* 场景:不同的墙面或贴满海报的墙面,近距离拍摄,与镜头 1 在视觉上明显不同。
* 构图:清晰拉远至中近景 / 半身构图。
* 角色:侦探 B 直接对镜头说唱。他的肩膀和头部随踩镲节奏律动,身体微微前倾。
* 字体:巨型压缩英文文字“CLUES”位于角色身后,自然被头发、肩膀和服装轮廓遮挡。
* 节奏:字体如同海报竖起般纵向拉伸。每一次军鼓响起时,文字突然放大、抖动,并产生扫描线错位。
* 硬切。

镜头 3 —— 手部特写 / 遮挡转场

* 场景:金属门边缘 / 栏杆 / 车库墙面 / 低矮天花板的一部分。
* 构图:聚焦双手、戒指、袖口和服装纹理的特写。
* 角色:侦探 A 向镜头推出一个手势,仿佛递出一条线索。他的脸在背景中保持模糊或局部可见。
* 字体:竖排“BROTHERS”出现在前景一侧,并短暂被手部遮挡。
* 节奏:在短语“move as one”处,字体拉伸为一条长长的竖直条带,随后随低音击打硬切并重构。
* 硬切。

镜头 4 —— 肩颈特写至面部特写 / 楼梯间转角

* 场景:楼梯间转角 / 阴影门口 / 低矮通道。
* 构图:以肩部、颈部、衣领和服装纹理的特写开始 → 在军鼓响起时突然推进至面部特写。
* 角色:侦探 B 转头并靠近镜头,同时继续说唱。
* 字体:“AS ONE”如时尚杂志标题般爆发式出现,并在节拍点突然放大。
* 节奏:推进过程中,字体突然硬切为新的版式。绝不能遮挡眼睛。
* 硬切。

镜头 5 —— 带运动残影的半身近景 / 车库或混凝土背景

* 场景:车库感空间或混凝土背景。
* 构图:侦探 A 的半身近景。
* 角色:主层人物需有清晰、精准同步的嘴部动作。次层形成动态运动残影——复印机风格的错位 / 帧延迟——同时保持面部结构完整且不失真。他的手势横向扫过镜头。
* 字体:竖排“CUT GOLD”在背景中以掉帧动画闪烁。
* 节奏:在“CUT”处,画面瞬间被水平切开,触发白闪硬切。“GOLD”压缩成厚重的字��块,随后突然回弹。
* 硬切。

镜头 6 —— 双人近景分屏 / 色块分割

* 场景:地下入口 / 墙面 / 栏杆 / 门框,与镜头 5 在视觉上明显不同。
* 构图:画面被分为两个或三个色块区域。通过快速硬切,在两位侦探的面部近景与裁切半身细节之间交替。
* 角色:两位侦探在左右两侧交替表演。
* 字体:中央出现醒目文字:“CASE COMPLETE”。
* 节奏:每次 808 低音击打时,构图都通过硬切重新组合。字母先压扁,随后立即拉伸。踩镲滚奏期间,字体碎片快速跳动。最后一个重音时,触发扫描错位并结合撕纸风格的震动。
* 硬切。

结尾 —— 多场景近景表演蒙太奇

* 场景:在狭窄走廊中的面部特写、靠墙的中近景、手部特写、楼梯间转角的肩颈特写、车库环境中的裁切半身镜头,以及阴影门口的双人近景之间快速交替。
* 构图:不要全身镜头和宽幅群像。仅使用近景、中近景、面部特写、手部特写、肩颈特写和半身镜头。
* 角色:两位侦探轮流直接对镜头说唱。嘴部动作、下颌运动、呼吸、眉眼和手势必须与人声、军鼓、踩镲滚奏和低音击打精准同步。
* 字体:最终主视觉文字“CASE CLOSED”以巨大的冲击力砸入画面。
* 节奏:每一次低音击打都触发场景硬切或突兀的景别变化。每一次军鼓都触发字体猛击或图层错位。最后一个节拍时,来自不同场景的全部碎片同时定格,随后硬切至黑屏。

【其他整体要求】

▍视觉风格 —— 贯穿整支视频

* 强烈颗粒、轻微胶片抖动、复印纸纹理、半调网点、粗糙印刷边缘、扫描错位、掉帧运动残影和高速图层套印偏差。
* 极快剪辑。仅使用硬切、跳切、节拍切、遮挡切、白闪硬切和由字体驱动的硬切。
* 不要淡入淡出、叠化或柔和转场。

▍字体 / 平面包装 —— 贯穿整支视频

* 字体必须作为画面的整合部分存在,并具备可信的空间层次。
* 相对于角色,文字可位于前景、中景或背景。
* 角色可以遮挡字体,字体也可覆盖角色的局部,但绝不能遮挡眼睛或关键面部表情。
* 字体必须通过出现、振动、拉伸、压缩、错位、撕裂和硬切重构,对人声重音、军鼓、踩镲滚奏和 808 低音击打做出反应。
* 风格:粗重压缩无衬线体、巨型英文块状字体、纵向拉伸、横向压缩、竖排英文、弧形标题、高对比黑 / 白 / 红、复印纸颗粒、半调网点、做旧印刷、扫描错位和 Zine 拼贴美学。
* 控制字体数量:每个镜头仅一个主要文字元素,最多少量编号。不要密集小字和标志。

▍节奏规则 —— 贯穿整支视频

* 踩镲滚奏 → 快速微振动、掉帧、碎片化字体重构。
* 军鼓 → 字体突然放大、画面硬切、角色肩膀向下击打。
* 808 低音击打 → 低频屏幕压缩、短暂画面变形、字体纵向拉伸或横向压缩。
* 人声关键词 → 同步嘴部动作、下颌运动、点头和向前手势。
* 角色动作、字体动画、场景切换和构图变化必须全部同时踩中节拍。

▍场景切换 —— 贯穿整支视频

* 在多个近距离环境之间快速硬切。
* 所有场景应保持 @Image 3 的整体氛围,但每个镜头必须使用明显不同的空间:狭窄走廊、近距离墙面、阴影门口、金属/混凝土背景、边缘光、海报墙、楼梯间转角、低矮天花板、车库感空间、地下入口。
* 不要大型建立镜头或复杂的大规模场景。
* 每一次场景变化必须由低音击打、军鼓、人声重音或字体猛击触发。

▍景别切换 —— 贯穿整支视频

* 景别变化必须非常明显:极致面部特写 → 中近景 / 半身 → 手部特写 → 肩颈特写 → 双人近景分屏 → 面部特写 → 裁切半身镜头。
* 不要连续使用相同景别。
* 每次硬切都应在镜头距离、角色朝向、背景空间和字体景深/图层关系上形成明显变化。
* 镜头运动可包括轻微手持、突然推进、短距离横移、快速压缩变焦和近距离摇摆。
* 不要将序列变成柔和或慢动作电影摄影。

▍角色规则 —— 贯穿整支视频

* 角色:两位飞探 / 兄弟。
* 保留 @Image 1 中角色的面部、发型、服装轮廓、比例、态度和整体氛围。
* 肤质应真实、哑光、干净且高级,带有自然毛孔和细微皮肤纹理。
* 不要油亮、过度磨皮的 AI 美颜滤镜脸。
* 两位兄弟以强烈表演能量轮流直接对镜头说唱。

▍角色表演 —— 贯穿整支视频

* 人声表达:冷峻、攻击性强、松弛却具有威慑力,采用紧凑、断裂、重音鲜明的节奏流。
* 这不是静态摆拍——他们正在积极表演。
* 清晰口型同步:嘴唇、下颌、面部表情和呼吸必须跟随人声。
* 节拍同步动作:点头、沉肩、向前手势、前倾、转头、转身、靠近镜头,以及手指直指镜头。

▍重要限制 —— 贯穿整支视频

* 不要全身镜头。
* 不要宽幅群像。
* 不要复杂人群或群体场景。
* 整支视频仅使用近景、中近景、面部特写、手部特写、肩颈特写和半身镜头。
* 仅展示角色上半身、面部、手势、服装纹理、表情、口型同步及字体/平面包装。
* 无需展示完整身体或脚部。
* 不得包含任何参考图像中的现实品牌、标志、标题或可识别原始文字。

结语

编写 MiniMax H3 提示词,意味着将创意想法转化为清晰的制作简报。

首先,定义每个参考素材的角色。接着,用一句聚焦的话概括视频。最后,以逻辑顺序描述镜头、动作、声音、文字和限制条件。相比一长串形容词,结构清晰且简洁的提示词通常更容易测试和修改。

你可以在 WeShop AI 的 MiniMax H3 工具页面中应用此模板,或从主 WeShop AI 工作区开始。设置时长、分辨率或参考文件要求前,请先查看当前界面,因为可用选项可能会发生变化。