WeShop AIWeShop AI
scroll left

AI 图像

特效

AI 视频

计划和定价

20% OFF

解决方案

资源

下载

Affiliate

API

scroll right
登录
资源
探索帮助您更快完成工作的指南和技巧。
blog
博客
blog
FAQ
feature request
功能请求
jobs
Jobs
app image
随时随地用WeShop AI进行创作
随时随地释放你的创造力。无论是在路上,还是在办公桌前,只需下载WeShop AI,就能将灵感转化为令人惊艳的设计。它强大而灵活,始终伴你左右。
August 11

MiniMax H3 提示词指南:公式、分镜、模板与常见错误

了解如何为 MiniMax H3 编写提示词,涵盖多模态参考、图生视频、文生视频、分镜、对话、声音和屏幕文字。

有效的 AI 视频提示词不需要几十个形容词,也不需要采用专业电影剧本的格式。它需要回答三个实际问题:

  1. 每个参考素材分别起什么作用?
  2. 视频的核心创意是什么?
  3. 画面和声音应如何随时间推进?

当在 MiniMax H3 中使用文本、图像、视频和音频参考时,你可以使用一个简单公式来组织这些指令:

完整提示词 = 参考素材说明 + 核心概念 + 视觉序列

对于需要更强连续性、产品还原度或复杂镜头运动的项目,可在最后添加一致性要求和排除项。

第 1 部分:定义每个参考素材的角色

上传参考文件后,首先说明每个素材应控制哪些内容。不要假设模型会自动识别它们之间的预期关系。

常见的参考角色包括:

  • 角色参考: 定义面部、发型、服装和整体外观。
  • 物体参考: 定义产品或道具。
  • 场景参考: 定义环境、空间布局和灯光。
  • 首帧或尾帧: 确定视频应如何开始或结束。
  • 风格参考: 指导颜色、纹理和视觉语言。
  • 构图参考: 指导主体位置和视觉关系。
  • 动作参考: 为人物或物体提供动作。
  • 镜头参考: 提供镜头运动模式。
  • 声音参考: 指导角色的声音。
  • 音频复用: 使用上传音轨的全部或部分内容。
  • 视频编辑参考: 指明在现有视频中需添加、移除或修改的元素。

参考素材说明块可以这样写:

@Image1 提供女主角的面部、发型和服装。
@Image2 提供黑暗城堡与清晨逆光。
@Video1 提供舞蹈动作。
@Audio1 提供音乐节奏和整体氛围。

如果某项特征必须保持一致,请直接说明这一要求:

保持 @Image1 中角色的面部特征、银色发型和白色刺绣服装一致。

第 2 部分:定义视频核心概念

核心概念应以一句话概括整个视频。至少应包括:

  1. 主体: 出现的人或物。
  2. 地点: 场景发生的位置。
  3. 事件: 主体执行的动作。
  4. 形式与风格: 广告、电影、动画、纪录片或其他处理方式。
  5. 镜头规则: 单个连续镜头、快速剪辑、航拍或其他方式。

例如:

一位外观遵循 @Image1 的年轻女性,在 @Image2 的樱花庭院中表演 @Video1 的剑舞动作。
使用写实电影感的中国古装风格,并以一个连续镜头呈现该段画面。

保持这段陈述简洁。如果核心创意包含多个互不相关的角色、地点或故事线,即使提供详细的镜头说明,也可能难以让结果保持连贯。

第 3 部分:描述视觉序列

你可以按时间范围或镜头来组织视觉序列。每个片段都应说明关键元素:

  • 镜头景别;
  • 主体与动作;
  • 镜头运动;
  • 对话或旁白;
  • 环境音、音乐和关键音效;
  • 必须出现的屏幕文字;
  • 不应出现的元素。

例如:

0–3 秒:全景。女子从左侧走入樱花庭院。
背景轻微虚化。仅使用脚步声和风吹树叶的声音。
无对白。

3–8 秒:切换至中景。她拔出剑并摆出起始姿势,
遵循 @Video1 中的动作。樱花飘落时,镜头缓慢向前推进。

8–12 秒:特写。剑光闪过,动作放慢,剑刃将
飘落的花瓣推向两侧。

12–15 秒:回到全景。她完成整段动作,放下剑,
并望向镜头。
非叙事内音乐:不适用。不要添加背景音乐。

这种结构可清晰建立动作、镜头运动和声音之间的关系,也让单独修改各个镜头更加容易。

三种生成模式下如何编写 MiniMax H3 提示词

1. 多模态参考生成

当你同时上传角色、动作、场景和音频参考时,请为每个文件指定明确职责。

@Image1 是角色参考。保持女主角的面部和服装一致。
@Image2 是背景参考。
@Video1 是动作参考。使用剑舞动作。
@Audio1 是音乐和情绪参考。
展示女主角在清晨的黑暗城堡中表演参考动作。
让剪辑点与音乐中的主要节拍同步。

避免上传参考素材却不说明其使用方式。视频可同时包含人物动作、镜头运动、剪辑和声音,因此应明确哪些元素对结果最重要。

20260811_1_fb52dea0-3c41-4a77-809b-152a480584ae_1255x294.png

screenshot-20260811-102227.png Clipboard_Screenshot_1785318067.png

2. 图生视频提示词

使用一张图像时,应说明它是首帧、角色参考,还是通用视觉参考。使用两张图像时,应定义起始帧和结束帧之间的关系。

@Image1 是首帧:一名女子手持长剑站在樱花树下。
让她从起始姿势运动至剑舞序列结束。
使用一个无剪辑的连续镜头。
保持角色、服装和庭院构图一致。

首尾帧工作流主要需要说明连接两帧的动作、灯光和声音。如需额外剪辑,请明确提出。 screenshot-20260811-122439.png

任务-66803765-1-4.png

3. 文生视频提示词

没有参考素材时,应更详细地描述主体、环境、动作、视觉风格、镜头和声音。

15 秒,16:9,写实自然纪录片风格。
黎明时分的薄雾湿地中,一只成年白鹤单脚站在浅水里,
缓慢将头转向镜头。
柔和逆光穿过薄雾,水面上泛起细小涟漪。
镜头从超广角全景缓慢推进至中景,全程不切镜。
仅使用风声、水声和远处鸟鸣。不要添加背景音乐。

相比“生成一只站在水中的鹤”,此版本定义了时长、画幅比例、主体、环境、灯光、动作、镜头方向和声音。 screenshot-20260811-124118.png

应如何拆分镜头?

使用剪辑点,而不是每秒加入一个新动作

MiniMax H3 提示词可以围绕镜头和剪辑点组织。在每个镜头内,保持一个主要动作。切镜后,必要时重新说明主体、景别和空间关系。

不必每秒引入不同动作。过于密集的指令可能会相互冲突,并掩盖主要事件。

使对话长度与镜头时长匹配

一个三秒镜头无法自然容纳很长的一句台词。将对话分配给镜头前,先大声读出来并估算其时长。

对于跨越剪辑点的对话,可描述 J-cut 或 L-cut:

  • J-cut: 下一个镜头的音频在画面切换前开始。
  • L-cut: 上一个镜头的音频在画面变化后继续。

示例:

镜头 1:画外音说道:“醒醒,醒醒。”

镜头 2:切换至一名中年女性的特写。她是上一镜头的说话者,
并继续说道:“该去上学了。”

不要将连续镜头与多镜头结构混用

如果要求一个连续镜头,就应描述同一连续空间内的运动。不要同时要求多个镜头、硬切或地点之间的突然跳转。

如果视频需要多个场景,请删除连续镜头指令,并清晰定义每一个剪辑点。

如何控制声音和屏幕文字

分离不同类型的声音

将声音视为多个不同层次:

  • 角色对白;
  • 旁白;
  • 环境音;
  • 动作音效;
  • 非叙事内音乐。

如果不需要背景音乐,请写:

非叙事内音乐:不适用。
不要添加背景音乐。

避免一边要求模型复用音乐,一边又要求没有背景音乐。如果想保留环境音但移除音乐,应明确区分两者。

写出准确的屏幕文字

如果视频需要标题、标志、标语或按钮,请提供确切文案:

手机屏幕上的标题为:“AI 视频创作”。
按钮文字为:“立即开始”。

你还可以控制位置、出现频率和动画效果:

标题仅在画面中央显示一次。
淡入,停留两秒,不要重复出现。

请务必手动检查生成的文字、标志和界面元素。AI 生成视频可能会拼写错误、变形、重复或更改这些细节。

用可见动作替换隐喻

“孤独如潮水般涌起”表达了一种情绪,但它并未定义一个可见场景。

应将这种感受转化为动作、构图、灯光、空间和声音:

一个人独自站在空荡的铁路站台中央。
镜头缓慢后拉。远处驶离列车的灯光逐渐消失,
只留下雨声和车站广播的回响。

具体的视觉指令通常比抽象的情绪语言更具可控性。

MiniMax H3 提示词的常见错误及修正方法

常见错误推荐修正方法
将所有内容写成一个大段落将参考素材、核心概念和镜头序列分开
上传素材却未定义用途为每个文件分配角色、动作、场景、构图或声音职责
包含相互矛盾的指令删除冲突的镜头、声音或风格要求
要求一个连续镜头和多次剪辑将序列改写为连续运动,或删除连续镜头规则
没有参考图却期待同一张脸上传角色图像并指定需要保留的特征
文生视频提示词过短添加主体、环境、动作、镜头、灯光和声音
仅使用抽象风格语言将其转化为可见的颜色、纹理、灯光和构图
在短镜头中塞入过多对白缩短台词或增加镜头时长
同时要求保留和移除音乐分别说明环境音、音效和非叙事内音乐
为多个参考素材赋予重叠职责定义每个素材的主要角色

可直接复制的 MiniMax H3 提示词模板

[参考素材说明]
@Image1:角色参考。保持 ________ 一致。
@Image2:产品/场景参考。保持 ________ 一致。
@Video1:动作/镜头/剪辑参考。使用 ________。
@Audio1:声音/音乐/节奏参考。使用 ________。

[核心概念]
时长:____ 秒。画幅比例:____。
主体 ________ 在 ________ 中执行 ________。
使用 ________ 视觉风格和 ________ 镜头规则。

[视觉序列]
0–__ 秒:景别 ________;画面 ________;动作 ________;
镜头运动 ________;声音 ________。

__–__ 秒:景别 ________;画面 ________;动作 ________;
镜头运动 ________;声音 ________。

__–__ 秒:景别 ________;画面 ________;动作 ________;
镜头运动 ________;声音 ________。

[文字和声音]
必需屏幕文字:“________。”
角色 ________ 说道:“________。”
环境音:________。
非叙事内音乐:________。

[一致性要求和排除项]
保持 ________ 一致。
不要包含 ________。
pasted-1785391007599.png 迷你马克斯.png 纯净场景.png
【参考素材指南】
@Image 3:场景视觉风格——街道 / 夜晚 / 地下空间、幽闭构图、环境纵深、胶片颗粒。
@Image 2:字体与平面包装——字体纹理、平面设计、动态字体、强烈动态图形冲击力。
@Image 1:角色外观——面部、发型、服装轮廓、身体比例、态度和整体氛围。

仅参考指定维度。不要直接复制参考图像。不得包含原始参考图像中的现实品牌、标志、标题或可识别文字。

【核心概念】
一支 10 秒、16:9 横版 Trap 音乐视频。两位飞探兄弟直接面向镜头表演,在多个紧凑的地下场景中轮流说唱。整支视频随 Trap 节拍律动,使用与节拍同步的硬切。每次低音击打时,高对比度、印刷海报风格的英文粗体字都会猛然冲入屏幕。

整体美学:地下音乐录像带 + 时尚杂志拼贴 + 高级时装编辑品质,呈现冷峻、克制的兄弟双人表演。

【视觉序列说明】

镜头 1 —— 极致面部特写 / 幽闭通道

* 场景:狭窄走廊或地下入口,近距离拍摄,参考 @Image 3。
* 构图:面部极致特写——脸部 / 眼睛 / 颈部与肩膀 / 部分衣领细节。
* 角色:侦探 A 直视镜头开始说唱,表情冷静却锋利。
* 字体:“TWO FLY”巨型粗体英文文字从画面顶部和底部压入,不遮挡眼睛。
* 节奏:在 808 低音击打时,“TWO FLY”立即垂直压缩,随后弹回。踩镲滚奏期间,字母边缘以细碎动作快速振动。在重读单词“fly”时,触发扫描线错位/故障效果。
* 硬切。

镜头 2 —— 中近景 / 字体墙背景

* 场景:不同的墙面或贴满海报的墙面,近距离拍摄,与镜头 1 在视觉上明显不同。
* 构图:清晰拉远至中近景 / 半身构图。
* 角色:侦探 B 直接对镜头说唱。他的肩膀和头部随踩镲节奏律动,身体微微前倾。
* 字体:巨型压缩英文文字“CLUES”位于角色身后,自然被头发、肩膀和服装轮廓遮挡。
* 节奏:字体如同海报竖起般纵向拉伸。每一次军鼓响起时,文字突然放大、抖动,并产生扫描线错位。
* 硬切。

镜头 3 —— 手部特写 / 遮挡转场

* 场景:金属门边缘 / 栏杆 / 车库墙面 / 低矮天花板的一部分。
* 构图:聚焦双手、戒指、袖口和服装纹理的特写。
* 角色:侦探 A 向镜头推出一个手势,仿佛递出一条线索。他的脸在背景中保持模糊或局部可见。
* 字体:竖排“BROTHERS”出现在前景一侧,并短暂被手部遮挡。
* 节奏:在短语“move as one”处,字体拉伸为一条长长的竖直条带,随后随低音击打硬切并重构。
* 硬切。

镜头 4 —— 肩颈特写至面部特写 / 楼梯间转角

* 场景:楼梯间转角 / 阴影门口 / 低矮通道。
* 构图:以肩部、颈部、衣领和服装纹理的特写开始 → 在军鼓响起时突然推进至面部特写。
* 角色:侦探 B 转头并靠近镜头,同时继续说唱。
* 字体:“AS ONE”如时尚杂志标题般爆发式出现,并在节拍点突然放大。
* 节奏:推进过程中,字体突然硬切为新的版式。绝不能遮挡眼睛。
* 硬切。

镜头 5 —— 带运动残影的半身近景 / 车库或混凝土背景

* 场景:车库感空间或混凝土背景。
* 构图:侦探 A 的半身近景。
* 角色:主层人物需有清晰、精准同步的嘴部动作。次层形成动态运动残影——复印机风格的错位 / 帧延迟——同时保持面部结构完整且不失真。他的手势横向扫过镜头。
* 字体:竖排“CUT GOLD”在背景中以掉帧动画闪烁。
* 节奏:在“CUT”处,画面瞬间被水平切开,触发白闪硬切。“GOLD”压缩成厚重的字��块,随后突然回弹。
* 硬切。

镜头 6 —— 双人近景分屏 / 色块分割

* 场景:地下入口 / 墙面 / 栏杆 / 门框,与镜头 5 在视觉上明显不同。
* 构图:画面被分为两个或三个色块区域。通过快速硬切,在两位侦探的面部近景与裁切半身细节之间交替。
* 角色:两位侦探在左右两侧交替表演。
* 字体:中央出现醒目文字:“CASE COMPLETE”。
* 节奏:每次 808 低音击打时,构图都通过硬切重新组合。字母先压扁,随后立即拉伸。踩镲滚奏期间,字体碎片快速跳动。最后一个重音时,触发扫描错位并结合撕纸风格的震动。
* 硬切。

结尾 —— 多场景近景表演蒙太奇

* 场景:在狭窄走廊中的面部特写、靠墙的中近景、手部特写、楼梯间转角的肩颈特写、车库环境中的裁切半身镜头,以及阴影门口的双人近景之间快速交替。
* 构图:不要全身镜头和宽幅群像。仅使用近景、中近景、面部特写、手部特写、肩颈特写和半身镜头。
* 角色:两位侦探轮流直接对镜头说唱。嘴部动作、下颌运动、呼吸、眉眼和手势必须与人声、军鼓、踩镲滚奏和低音击打精准同步。
* 字体:最终主视觉文字“CASE CLOSED”以巨大的冲击力砸入画面。
* 节奏:每一次低音击打都触发场景硬切或突兀的景别变化。每一次军鼓都触发字体猛击或图层错位。最后一个节拍时,来自不同场景的全部碎片同时定格,随后硬切至黑屏。

【其他整体要求】

▍视觉风格 —— 贯穿整支视频

* 强烈颗粒、轻微胶片抖动、复印纸纹理、半调网点、粗糙印刷边缘、扫描错位、掉帧运动残影和高速图层套印偏差。
* 极快剪辑。仅使用硬切、跳切、节拍切、遮挡切、白闪硬切和由字体驱动的硬切。
* 不要淡入淡出、叠化或柔和转场。

▍字体 / 平面包装 —— 贯穿整支视频

* 字体必须作为画面的整合部分存在,并具备可信的空间层次。
* 相对于角色,文字可位于前景、中景或背景。
* 角色可以遮挡字体,字体也可覆盖角色的局部,但绝不能遮挡眼睛或关键面部表情。
* 字体必须通过出现、振动、拉伸、压缩、错位、撕裂和硬切重构,对人声重音、军鼓、踩镲滚奏和 808 低音击打做出反应。
* 风格:粗重压缩无衬线体、巨型英文块状字体、纵向拉伸、横向压缩、竖排英文、弧形标题、高对比黑 / 白 / 红、复印纸颗粒、半调网点、做旧印刷、扫描错位和 Zine 拼贴美学。
* 控制字体数量:每个镜头仅一个主要文字元素,最多少量编号。不要密集小字和标志。

▍节奏规则 —— 贯穿整支视频

* 踩镲滚奏 → 快速微振动、掉帧、碎片化字体重构。
* 军鼓 → 字体突然放大、画面硬切、角色肩膀向下击打。
* 808 低音击打 → 低频屏幕压缩、短暂画面变形、字体纵向拉伸或横向压缩。
* 人声关键词 → 同步嘴部动作、下颌运动、点头和向前手势。
* 角色动作、字体动画、场景切换和构图变化必须全部同时踩中节拍。

▍场景切换 —— 贯穿整支视频

* 在多个近距离环境之间快速硬切。
* 所有场景应保持 @Image 3 的整体氛围,但每个镜头必须使用明显不同的空间:狭窄走廊、近距离墙面、阴影门口、金属/混凝土背景、边缘光、海报墙、楼梯间转角、低矮天花板、车库感空间、地下入口。
* 不要大型建立镜头或复杂的大规模场景。
* 每一次场景变化必须由低音击打、军鼓、人声重音或字体猛击触发。

▍景别切换 —— 贯穿整支视频

* 景别变化必须非常明显:极致面部特写 → 中近景 / 半身 → 手部特写 → 肩颈特写 → 双人近景分屏 → 面部特写 → 裁切半身镜头。
* 不要连续使用相同景别。
* 每次硬切都应在镜头距离、角色朝向、背景空间和字体景深/图层关系上形成明显变化。
* 镜头运动可包括轻微手持、突然推进、短距离横移、快速压缩变焦和近距离摇摆。
* 不要将序列变成柔和或慢动作电影摄影。

▍角色规则 —— 贯穿整支视频

* 角色:两位飞探 / 兄弟。
* 保留 @Image 1 中角色的面部、发型、服装轮廓、比例、态度和整体氛围。
* 肤质应真实、哑光、干净且高级,带有自然毛孔和细微皮肤纹理。
* 不要油亮、过度磨皮的 AI 美颜滤镜脸。
* 两位兄弟以强烈表演能量轮流直接对镜头说唱。

▍角色表演 —— 贯穿整支视频

* 人声表达:冷峻、攻击性强、松弛却具有威慑力,采用紧凑、断裂、重音鲜明的节奏流。
* 这不是静态摆拍——他们正在积极表演。
* 清晰口型同步:嘴唇、下颌、面部表情和呼吸必须跟随人声。
* 节拍同步动作:点头、沉肩、向前手势、前倾、转头、转身、靠近镜头,以及手指直指镜头。

▍重要限制 —— 贯穿整支视频

* 不要全身镜头。
* 不要宽幅群像。
* 不要复杂人群或群体场景。
* 整支视频仅使用近景、中近景、面部特写、手部特写、肩颈特写和半身镜头。
* 仅展示角色上半身、面部、手势、服装纹理、表情、口型同步及字体/平面包装。
* 无需展示完整身体或脚部。
* 不得包含任何参考图像中的现实品牌、标志、标题或可识别原始文字。

结语

编写 MiniMax H3 提示词,意味着将创意想法转化为清晰的制作简报。

首先,定义每个参考素材的角色。接着,用一句聚焦的话概括视频。最后,以逻辑顺序描述镜头、动作、声音、文字和限制条件。相比一长串形容词,结构清晰且简洁的提示词通常更容易测试和修改。

你可以在 WeShop AI 的 MiniMax H3 工具页面中应用此模板,或从主 WeShop AI 工作区开始。设置时长、分辨率或参考文件要求前,请先查看当前界面,因为可用选项可能会发生变化。