MiniMax H3(Hailuo)AI 舞蹈:根据参考视频和角色图片创建双人舞蹈视频
了解如何使用 MiniMax H3,通过参考舞蹈片段和两张角色图片,生成锁定镜头、动作编排受引导的双人 AI 舞蹈视频。
一位舞者从镜头近处开始,像折扇一样张开双手,随后向后退步,第二位角色在她身后加入舞蹈编排。动作、间距和构图均来自现有舞蹈片段——但舞者本身可以替换为你自己的角色设计。
本 MiniMax H3 AI 舞蹈工作流展示了如何结合 一个参考视频、两张角色参考图片和一个结构化提示词,在保留原始编舞作为动作引导的同时,创建一段简短的双人舞蹈视频。
此 MiniMax H3 AI 舞蹈工作流适合谁
如果你希望实现以下目标,此工作流会很有帮助:
- 创建 AI 舞蹈或角色舞蹈视频;
- 使用不同角色复现参考片段的动作结构;
- 在同一个 MiniMax H3 工作流中结合参考视频和角色设计素材;
- 为社交媒体制作短篇角色内容。
目标并不是让模型随机创作一段舞蹈,而是让参考片段提供可供遵循的具体编舞和构图。
你将创建什么
目标成果是一段简短的竖屏双人舞蹈视频,具有四个明显特点:
- 编舞、节奏、构图和舞者间距遵循所提供的参考视频;
- 主舞者采用自定义红白洛丽塔角色设计;
- 配舞者采用独立的男性角色参考;
- 场景始终保持在一个连续、固定的竖屏镜头中。
这种职责分离非常重要:视频定义角色如何移动,而角色参考则定义场景中出现谁。
准备三类输入素材
1. 参考舞蹈视频
参考视频为生成提供动作结构。
在本示例中,这段约 13 秒的片段可理解为四个阶段:
- **开场近景:**主舞者在镜头附近开始,在脸部周围做精致的手势。
- **后退展示:**她向后移动,直至两位舞者都清晰可见。
- **同步编舞:**两位角色完成协调的手腕交叉、张开手势、侧向推掌、手腕旋转和手臂动作。
- **结束姿势:**两位舞者面向前方,以受控姿势收尾。
与其只将舞蹈描述为“可爱编舞”这类风格,不如明确动作及其顺序。这能为模型提供更具体的跟随信息。

参考片段确定了编舞、舞者间距和固定镜头构图。
2. 主角色参考
第一张角色图片控制主舞者的视觉身份。
在本示例中,最重要的可识别特征包括:
- 黑色双辫子;
- 大型红白蝴蝶结头饰;
- 多层红白波点洛丽塔连衣裙;
- 蕾丝和蝴蝶结细节;
- 白色手腕配饰;
- 红色鞋子。
多视角角色设定图在此特别有用,因为服装包含许多细节,这些细节需要在角色移动时保持视觉连贯。

主角色参考定义了舞者的发型、服装、比例和可识别的视觉细节。
3. 配舞者参考
第二张参考图片控制配舞者的外观。
对于双人 AI 舞蹈视频,如果两张角色参考在视觉上足够鲜明,会更有帮助。在本例中,配角拥有鲜明的紫色轮廓,能够与红白配色的主舞者清楚区分开来。
随后,提示词可以聚焦于他在编舞中的角色:
- 站在主舞者稍后方;
- 保持在构图左侧;
- 镜像跟随编舞;
- 自信地移动,但不占据主位。

第二个角色参考赋予配舞者独立且可识别的身份。
在 MiniMax H3 中设置参考素材
对于此工作流,请为每项输入分配明确的任务,而不是试图把所有指令都塞进提示词中。
使用:
- **参考视频:**舞蹈片段;
- **角色设计参考:**主舞者图片和配舞者图片;
- **提示词:**场景、角色定位、动作顺序、镜头行为和质量约束。
一种实用的理解方式是:
- 参考视频 = 他们如何移动
- 角色图片 = 他们是谁
- 提示词 = 场景在哪里发生,以及哪些内容必须保持一致

生成前,将舞蹈片段作为参考视频附加,并将两张角色设定图作为角色设计参考。
使用结构化提示词创建 AI 舞蹈视频
像“让这两个角色一起跳舞”这样的模糊提示词,会留下太多未决定的内容。
为了获得更好的控制,请将指令分为五个部分:
- 总体任务;
- 场景和镜头;
- 主角色;
- 编舞顺序;
- 一致性和人体结构约束。
请使用以下提示词作为起点:
参考视频:@{video1}
角色设计参考:@{image1} @{image2}
创建一段 13 秒的竖屏舞蹈视频,逐拍匹配参考 @{video1} 视频的编舞、节奏、构图和舞者间距。
角色参考 @{image1} 应控制主女性舞者的脸部、发型、身体比例和红白甜美洛丽塔服装。
使用一个连续、固定的智能手机镜头,场景设在宽敞的现代公寓中,拥有暖米色墙壁、白色天花板、嵌入式照明、深色家具和抛光地板。使用自然室内光线,呈现真实的社交媒体舞蹈视频质感。不要剪辑或转场。
主舞者 @{image1} 在镜头近处、略偏画面右侧的位置开始,身穿多层红白波点洛丽塔连衣裙,带有丰富的蕾丝和蝴蝶结、大型配套头饰、黑色双辫子、白色腕部饰品和红色鞋子。一名男性 @{image2} 配舞者站在她左侧后方一步的位置。
她先在脸部附近做精致、轻盈的手势,将双掌合拢,再像折扇一样张开手指。随后她向后退,直至两位舞者都能从头部到膝盖以下清晰可见。
他们进行相同的同步手部编舞:双手手腕交叉成“X”形,像打开折扇一样向外翻开手掌,左右交替推出张开的手掌,流畅地绕圈旋转手腕,双前臂从胸前滚动划过,再将双手向下扫至腰部附近。
重复交叉和张开折扇手势,同时通过小步伐和轻柔的胯部摆动,让身体重心左右转移。
男性舞者在主舞者稍后方镜像跟随编舞,动作自信且受控。主舞者保持可爱活泼的表情,望向镜头,同时她的多层裙摆自然弹动和摇曳。
最后,两位舞者都面向前方,一只手臂弯曲横于胸前,另一只手臂下垂在腰部附近。
使用流畅的实时动作、准确同步的手部动作、一致的面部特征和可信的连衣裙物理效果。不要手持镜头运动、服装变化、重复手指、多余肢体或扭曲身体。
此 MiniMax H3 参考提示词为何有效
1. 定义参考视频应控制的内容
第一句话指出了四项具体属性:
- 编舞;
- 节奏;
- 构图;
- 舞者间距。
这比简单地说“跟随这个视频”清晰得多。它告诉生成模型,参考素材的哪些部分需要被保留。
2. 为每个角色参考赋予明确角色
主舞者明确关联至 @{image1},包括她的脸部、发型、比例和服装。
配舞者关联至 @{image2},并被赋予不同的空间位置和编舞角色。
这减少了两个角色参考之间的歧义。
3. 在描述舞蹈前锁定镜头
提示词指定了:
- 一个连续镜头;
- 固定的智能手机构图;
- 不要剪辑;
- 不要转场。
这些约束让视频专注于编舞,而不会引入不必要的镜头变化。
4. 按顺序描述动作
具体的动作指令比抽象描述更有用。
例如:
- 双手手腕交叉成“X”形;
- 向外张开手掌;
- 左右交替推掌;
- 旋转手腕;
- 前臂从胸前滚动划过;
- 将双手扫向腰部。
这为模型提供了一条有序的动作路径,而参考视频则提供动作时机。
生成视频并审核结果
参考视频、两张角色图片和提示词准备就绪后,生成片段,并将结果与原始参考进行比较。
你可以直接使用右侧工具进行尝试。
在决定生成结果是否可用之前,请检查以下五个方面。
1. 检查双舞者位置
预期构图为:
- 主舞者起始时更靠近镜头,并略偏画面右侧;
- 配舞者在她左侧后方一步的位置开始;
- 主舞者后退后,两位舞者均保持可见。
如果配舞者消失或移动到错误的一侧,请加强空间位置指令,而不是重写整个提示词。
2. 检查手部编舞
以手部动作为主的舞蹈视频对视觉错误尤其敏感。
注意检查:
- 手指融合或重复;
- 手腕扭曲;
- 交叉和张开手势不完整;
- 左右动作不匹配;
- 两位舞者之间的同步错误。
优先关注定义编舞的动作,而不是不影响整体舞蹈的细微差异。
3. 检查脸部和发型一致性
对于主舞者,请确认生成视频在整个片段中保持相同且可识别的身份。
注意:
- 脸部一致性;
- 黑色双辫子;
- 大型蝴蝶结头饰;
- 角色移动时稳定的头发和配饰位置。
4. 检查运动中的洛丽塔服装
多层连衣裙带来了另一项一致性挑战,因为它包含许多相互重叠的元素。
检查输出是否保留:
- 红白配色身份;
- 大型头部蝴蝶结;
- 多层裙摆形状;
- 可见的蕾丝和蝴蝶结细节;
- 踏步和胯部移动时合理的裙摆运动。
目标并非逐帧完美,而是让服装在整段舞蹈中保持可识别性和物理可信度。
5. 检查结束姿势
片段应有意地结束,而不是只是时间耗尽。
两位舞者都应:
- 面向镜头;
- 稳定在预期的结束位置;
- 干净利落地完成手臂动作;
- 在镜头结束时保持视觉稳定。
| 参考编舞 | MiniMax H3 结果 |
|---|---|
![]() | ![]() |
| 参考动作和舞者间距。 | 生成的角色遵循相同舞蹈结构。 |
如果首次生成不稳定,应如何调整
如果首个结果需要再次优化,请一次只修改一个类别。
修复 1:舞蹈相似,但编舞不正确
加强动作顺序描述。
不要增加更多美学描述,而应明确指出缺失或顺序错误的具体手势。
修复 2:两个角色混淆了
强化参考分配:
@{image1}控制主女性舞者;@{image2}控制男性配舞者;- 配舞者始终位于主舞者后方;
- 配舞者镜像跟随编舞,但不占据领舞位置。
修复 3:镜头开始移动
重复镜头限制:
一个连续镜头
固定的智能手机镜头
不要剪辑或转场
这能使构图更接近社交媒体舞蹈录制视频,而非多镜头序列。
修复 4:手部或身体发生扭曲
在提示词末尾保留简洁的负面约束:
不要重复手指、多余肢体、扭曲身体或服装变化。
这些指令无法保证完美的人体结构,但能明确所期望的质量边界。
将参考舞蹈变成你自己的角色表演
此 MiniMax H3 AI 舞蹈工作流最强大的部分在于控制职责的划分:参考视频提供编舞,角色设定图提供视觉身份,提示词则将它们连接到一个受控场景中。
一旦这一关系明确,你便可以将相同结构复用于不同的角色组合、服装和短篇舞蹈创意,而无需从头重建编舞。前往 WeShop 尝试 MiniMax H3 工作流,先从一个简短的参考片段开始,再逐步制作更复杂的场景。








