MiniMax H3 提示詞指南:公式、分鏡、範本與常見錯誤
了解如何為 MiniMax H3 撰寫多模態參考、圖生影片、文生影片、分鏡、對白、聲音與畫面文字提示詞。
有效的 AI 影片提示詞不需要幾十個形容詞,也不需要專業劇本的格式。它需要回答三個實際問題:
- 每項參考素材分別扮演什麼角色?
- 影片的核心概念是什麼?
- 視覺與聲音應如何隨時間發展?
在 MiniMax H3 中使用文字、圖片、影片和音訊參考時,你可以用簡單公式來組織這些指示:
完整提示詞 = 參考素材指示 + 核心概念 + 視覺序列
若專案需要更強的連續性、產品一致性或複雜的鏡頭運動,可在最後加入一致性要求與排除項目。
第 1 部分:定義每項參考素材的角色
上傳參考檔案時,請先說明每項素材應控制什麼。不要假設模型會自動識別它們之間預期的關係。
常見的參考角色包括:
- 角色參考: 定義臉部、髮型、服裝與整體外觀。
- 物件參考: 定義產品或道具。
- 場景參考: 定義環境、空間配置與燈光。
- 第一幀或最後一幀: 建立影片應如何開始或結束。
- 風格參考: 引導色彩、質感與視覺語言。
- 構圖參考: 引導主體位置與視覺關係。
- 動作參考: 提供人物或物件的動作。
- 鏡頭參考: 提供攝影機運動模式。
- 聲音參考: 引導角色聲線。
- 音訊重用: 使用上傳音軌的全部或部分內容。
- 影片剪輯參考: 指定在現有影片中要新增、移除或修改的元素。
參考素材區塊可以如下所示:
@Image1 提供女主角的臉部、髮型與服裝。
@Image2 提供黑暗城堡與清晨逆光。
@Video1 提供舞蹈動作。
@Audio1 提供音樂節奏與整體情緒。
若某項特徵必須保持一致,請直接說明此要求:
保持 @Image1 中角色的臉部特徵、銀色髮型與白色刺繡服裝一致。
第 2 部分:定義影片核心概念
核心概念應以一句話概述整支影片。至少包含:
- 主體: 出現的是誰或什麼。
- 地點: 場景發生在哪裡。
- 事件: 主體做什麼。
- 形式與風格: 廣告、電影、動畫、紀錄片或其他處理方式。
- 鏡頭規則: 一鏡到底、快速剪輯、空拍畫面或其他方式。
例如:
一位外觀遵循 @Image1 的年輕女性,在 @Image2 的櫻花庭院中
表演 @Video1 的劍舞動作。採用寫實電影感的中國古裝風格,
並將整段內容呈現為一鏡到底。
請讓這段說明保持精簡。若核心概念包含多個無關的角色、地點或故事線,即使有詳細的鏡頭指示,結果仍可能難以維持連貫。
第 3 部分:描述視覺序列
你可以依時間區間或鏡頭來安排視覺序列。每個段落都應說明重要元素:
- 鏡頭景別;
- 主體與動作;
- 攝影機運動;
- 對白或旁白;
- 環境音、音樂與關鍵音效;
- 必須出現的畫面文字;
- 不應出現的元素。
例如:
0–3 秒:全景。女性從左側進入櫻花庭院。
背景柔和失焦。只使用腳步聲與風吹樹葉的聲音。
無對白。
3–8 秒:切換至中景。她拔出劍並採取起始姿勢,
遵循 @Video1 的動作。櫻花落下時,攝影機緩慢向前推進。
8–12 秒:特寫。劍光閃現,動作放慢,劍身將
飄落的花瓣推向兩側。
12–15 秒:回到全景。她完成整段動作,放下劍,
並望向攝影機。
非敘事內音樂:無。請勿加入背景音樂。
此結構可建立動作、攝影機運動與聲音之間清楚的關係,也讓個別鏡頭更容易修改。
如何為三種生成模式撰寫 MiniMax H3 提示詞
1. 多模態參考生成
同時上傳角色、動作、場景與音訊參考時,請為每個檔案分配明確職責。
@Image1 是角色參考。保持女主角的臉部與服裝一致。
@Image2 是背景參考。
@Video1 是動作參考。使用劍舞動作。
@Audio1 是音樂與情緒參考。
呈現女主角在清晨的黑暗城堡中表演所參考的動作。
讓剪輯時間點對齊音樂中的主要節拍。
避免上傳參考素材卻不說明其使用方式。影片可能同時包含動作、鏡頭運動、剪輯與聲音,因此請指出哪些元素對結果最重要。

|
|
2. 圖生影片提示詞
使用一張圖片時,請說明它是第一幀、角色參考,還是一般視覺參考。使用兩張圖片時,請定義起始幀與結束幀之間的關係。
@Image1 是第一幀:一名女性手持劍站在櫻花樹下。
讓她從起始姿勢動態演出至劍舞序列結束。
使用一鏡到底,不要切鏡。
保持角色、服裝與庭院構圖一致。
第一幀與最後一幀的工作流程,主要需要描述連接兩幀的動作、燈光與聲音。若希望加入額外切鏡,請明確提出要求。

|
3. 文生影片提示詞
沒有參考素材時,請更詳細描述主體、場景、動作、視覺風格、攝影機與聲音。
15 秒,16:9,寫實自然紀錄片風格。
黎明時分的霧氣濕地中,一隻成年白鶴單腳站在淺水裡,
並緩慢將頭轉向攝影機。
柔和的逆光穿過霧氣,細小漣漪在水面上擴散。
攝影機從超廣角全景緩慢推進至中景,中間不切鏡。
只使用風聲、水聲與遠方鳥鳴。請勿加入背景音樂。
相較於「生成一隻站在水中的白鶴」,此版本定義了時長、長寬比、主體、環境、燈光、動作、鏡頭方向與聲音。

應該如何拆分鏡頭?
使用切點,而非每秒加入一個新動作
MiniMax H3 提示詞可圍繞鏡頭與切點來安排。在每個鏡頭內,請保留一個主要動作。切鏡後,必要時重新說明主體、景別與空間關係。
不需要每秒引入不同的動作。過於密集的指示可能彼此衝突,並模糊主要事件。
讓對白長度符合鏡頭時長
三秒鐘的鏡頭無法自然容納一段很長的台詞。請先朗讀對白並估算時長,再將其分配至鏡頭中。
若對白跨越切鏡,請描述 J-cut 或 L-cut:
- J-cut: 下一個鏡頭的音訊在視覺切鏡之前開始。
- L-cut: 前一個鏡頭的音訊在畫面切換後持續播放。
範例:
鏡頭 1:畫外音說:「起床,起床。」
鏡頭 2:切換至一名中年女性的特寫。她是前一鏡頭的說話者,
並接著說:「該去上學了。」
不要混用一鏡到底與多鏡頭結構
若要求一鏡到底,請描述單一連續空間中的運動。不要同時要求多個鏡頭、硬切或地點之間的突然跳轉。
若影片需要多個場景,請移除一鏡到底的指示,並清楚定義每個切點。
如何控制聲音與畫面文字
分開處理不同類型的聲音
將聲音視為數個不同層次:
- 角色對白;
- 旁白;
- 環境音;
- 動作音效;
- 非敘事內音樂。
若不希望有背景音樂,請寫:
非敘事內音樂:無。
請勿加入背景音樂。
避免一邊要求模型重用音樂,一邊又要求不要背景音樂。若想保留環境音但移除音樂,請清楚區分兩者。
寫出精確的畫面文字
若影片需要標題、標誌、標語或按鈕,請加入確切文字:
手機螢幕上的標題顯示:「AI Video Creation。」
按鈕文字顯示:「Start Now。」
你也可以控制位置、出現頻率與動畫:
標題只在畫面中央出現一次。
淡入後停留兩秒,且不要重複出現。
請務必手動檢查生成的文字、標誌與介面元素。AI 生成影片可能會拼錯、扭曲、重複或變更這些細節。
以可見動作取代隱喻
「孤獨如潮水般湧起」表達的是情緒,但並未定義可見場景。
請將感受轉化為動作、構圖、燈光、空間與聲音:
一個人獨自站在空曠鐵路月台的中央。
攝影機緩慢拉遠。駛離列車的燈光在遠方消失,
只留下雨聲與車站廣播的回音。
具體的視覺指示通常比抽象的情緒語言提供更多控制力。
常見 MiniMax H3 提示詞錯誤與修正方式
| 常見錯誤 | 建議修正方式 |
|---|---|
| 將所有內容寫成一大段文字 | 分開說明參考素材、核心概念與鏡頭序列 |
| 上傳素材卻未定義用途 | 為每個檔案分配角色、動作、場景、構圖或聲音角色 |
| 包含互相矛盾的指示 | 移除衝突的鏡頭、聲音或風格要求 |
| 要求一鏡到底與多次切鏡 | 將序列改寫為連續運動,或移除一鏡到底規則 |
| 未提供角色參考圖卻期待相同臉孔 | 上傳角色圖片,並指出要保留的特徵 |
| 文生影片提示詞過短 | 加入主體、場景、動作、鏡頭、燈光與聲音 |
| 僅使用抽象風格語言 | 將其轉換為可見的色彩、質感、燈光與構圖 |
| 在短鏡頭中塞入太多對白 | 縮短台詞或增加鏡頭時長 |
| 同時要求保留與移除音樂 | 分開描述環境音、音效與非敘事內音樂 |
| 為多個參考素材分配重疊職責 | 定義每項素材的主要角色 |
可直接複製的 MiniMax H3 提示詞範本
[參考素材指示]
@Image1:角色參考。保持 ________ 一致。
@Image2:產品/場景參考。保持 ________ 一致。
@Video1:動作/鏡頭/剪輯參考。使用 ________。
@Audio1:聲音/音樂/節奏參考。使用 ________。
[核心概念]
時長:____ 秒。長寬比:____。
主體 ________ 在 ________ 中進行 ________。
使用 ________ 視覺風格與 ________ 鏡頭規則。
[視覺序列]
0–__ 秒:景別 ________;畫面 ________;動作 ________;
攝影機運動 ________;聲音 ________。
__–__ 秒:景別 ________;畫面 ________;動作 ________;
攝影機運動 ________;聲音 ________。
__–__ 秒:景別 ________;畫面 ________;動作 ________;
攝影機運動 ________;聲音 ________。
[文字與聲音]
必要畫面文字:「________。」
角色 ________ 說:「________。」
環境音:________。
非敘事內音樂:________。
[一致性要求與排除項目]
保持 ________ 一致。
不要包含 ________。
|
|
|
【參考素材指南】
@Image 3:場景視覺風格——街道/夜晚/地下空間、幽閉構圖、環境景深、膠片顆粒。
@Image 2:字體與平面視覺包裝——字體質感、平面設計、動態字體、強烈動態圖形衝擊力。
@Image 1:角色外觀——臉孔、髮型、服裝輪廓、身體比例、態度與整體氛圍。
僅參考指定的維度。請勿直接複製參考圖片。請勿包含原始參考圖片中的真實世界品牌、標誌、標題或可辨識文字。
【核心概念】
一支 10 秒、16:9 橫向的 trap 音樂錄影帶。兩位時髦的偵探兄弟直接面向鏡頭演出,在多個狹窄的地下場景中輪流饒舌。整支影片隨著 trap 節拍推進,使用與節拍同步的硬切。每次低音擊中時,高對比、印刷海報風格的英文粗體字會猛烈撞入畫面。
整體美學:地下音樂錄影帶 + 時尚雜誌拼貼 + 高級時裝編輯質感,呈現冷冽且克制的兄弟雙人演出。
【視覺序列描述】
鏡頭 1 —— 極致臉部特寫/幽閉通道
* 場景:狹窄走廊或地下入口,以近距離拍攝,參考 @Image 3。
* 構圖:臉部極致特寫——臉/眼睛/頸部與肩膀/部分領口細節。
* 角色:偵探 A 直視鏡頭並開始饒舌,表情冷靜但銳利。
* 字體:巨大的粗體英文文字「TWO FLY」推入畫面上方與下方,且不遮擋眼睛。
* 節奏:在 808 低音擊中時,「TWO FLY」立即垂直壓縮,接著彈回。踩鈸連打時,字母邊緣以細微的碎裂動態快速震動。在重讀的「fly」一詞時,觸發掃描線位移/故障效果。
* 硬切。
鏡頭 2 —— 中近景/字體牆背景
* 場景:不同的牆面或覆滿海報的牆面,以近距離拍攝,視覺上與鏡頭 1 明顯不同。
* 構圖:明確拉遠至中近景/半身構圖。
* 角色:偵探 B 直接面向鏡頭饒舌。他的肩膀與頭部隨踩鈸節奏律動,身體微微前傾。
* 字體:巨大的濃縮英文文字「CLUES」位於角色後方,自然地被髮型、肩膀與服裝輪廓遮擋。
* 節奏:字體如同海報豎起般垂直拉伸。每次軍鼓聲響起時,文字突然放大、震動並產生掃描線位移。
* 硬切。
鏡頭 3 —— 手部特寫/遮擋轉場
* 場景:金屬門邊緣/欄杆/車庫牆面/低矮天花板的一段區域。
* 構圖:聚焦於手部、戒指、袖口與服裝質感的特寫。
* 角色:偵探 A 將手勢推向鏡頭,如同遞出一條線索。他的臉部在背景中保持模糊或部分可見。
* 字體:垂直的「BROTHERS」出現在前景一側,並短暫被手遮擋。
* 節奏:在「move as one」這句時,字體拉伸成一條長長的垂直字帶,接著在低音擊中時硬切並重組。
* 硬切。
鏡頭 4 —— 肩頸特寫至臉部特寫/樓梯間轉角
* 場景:樓梯間轉角/陰影中的門口/低矮通道。
* 構圖:從肩膀、頸部、領口與服裝質感的特寫開始 → 在軍鼓聲響起時突然推進為臉部特寫。
* 角色:偵探 B 轉頭並在持續饒舌時靠近鏡頭。
* 字體:「AS ONE」如時尚雜誌標題般爆發出現,並隨節拍突然放大。
* 節奏:推進過程中,字體突然硬切為新的版面配置。絕不可遮擋眼睛。
* 硬切。
鏡頭 5 —— 帶動態殘影的半身近景/車庫或混凝土背景
* 場景:車庫感空間或混凝土背景。
* 構圖:偵探 A 的半身近景。
* 角色:主圖層具有清晰且精準同步的嘴型動作。次圖層創造動態殘影——影印機風格的位移/幀延遲——同時保持臉部結構完整且不失真。他的手勢橫向���過鏡頭。
* 字體:垂直的「CUT GOLD」以掉幀動畫在背景中閃爍。
* 節奏:在「CUT」時,畫面立即被水平切開,觸發白閃硬切。「GOLD」壓縮為厚重的字體方塊,接著突然回彈。
* 硬切。
鏡頭 6 —— 雙人近景分割畫面/色塊分區
* 場景:地下入口/牆面/欄杆/門框,在視覺上與鏡頭 5 明顯不同。
* 構圖:畫面分為兩至三個色塊區域。透過快速硬切,在兩位偵探的臉部特寫與裁切半身細節之間交替。
* 角色:兩位偵探在左、右兩側輪流演出。
* 字體:中央出現粗體文字:「CASE COMPLETE」。
* 節奏:每次 808 低音擊中時,構圖透過硬切重組。字母先壓扁,隨即拉伸。踩鈸連打時,碎裂字體快速跳動。在最後一個重拍,觸發掃描位移結合撕紙風格的震動。
* 硬切。
結尾 —— 多場景近景演出蒙太奇
* 場景:在狹窄走廊中的臉部特寫、靠牆的中近景、手部特寫、樓梯間轉角的肩頸特寫、車庫環境中的裁切半身鏡頭,以及陰影門口中的雙人近景之間快速交替。
* 構圖:不使用全身鏡頭與寬幅群像鏡頭。僅使用近景、中近景、臉部特寫、手部特寫、肩頸特寫與半身鏡頭。
* 角色:兩位偵探輪流直接面向鏡頭饒舌。嘴型、下顎動作、呼吸、眉眼與手勢必須精確對齊人聲、軍鼓、踩鈸連打與低音擊中。
* 字體:最終主標文字「CASE CLOSED」以巨大力度撞入畫面。
* 節奏:每次低音擊中都觸發場景硬切或突兀的景別變化。每次軍鼓聲都觸發字體撞擊或圖層位移。最後一拍時,不同場景的所有碎片同時定格,接著硬切至黑畫面。
【額外整體要求】
▍視覺風格 —— 全片貫穿
* 厚重顆粒、細微膠片抖動、影印紙張質感、半調網點、粗糙印刷邊緣、掃描位移、掉幀動態殘影,以及高速圖層錯位。
* 極快速剪輯。僅使用硬切、跳切、節拍切、遮擋切、白閃硬切及由字體驅動的硬切。
* 不要淡出、不要疊化,也不要柔和轉場。
▍字體/平面視覺包裝 —— 全片貫穿
* 字體必須作為畫面整合的一部分,並具備可信的空間分層。
* 相對於角色,文字可存在於前景、中景或背景。
* 角色可以遮擋字體,字體也可以覆蓋角色的部分區域,但絕不可遮擋眼睛或關鍵臉部表情。
* 字體必須透過出現、震動、拉伸、壓縮、位移、撕裂與硬切重組,回應人聲重音、軍鼓、踩鈸連打與 808 低音擊中。
* 風格:厚重濃縮無襯線字體、巨型英文粗體字、垂直拉伸、水平壓縮、垂直排列英文文字、弧形標題、高對比黑/白/紅、影印紙張顆粒、半調網點、破損印刷、掃描位移與小誌拼貼美學。
* 保持字體數量克制:每個鏡頭僅一個主要文字元素,最多少量編號。不要密集小字與標誌。
▍節奏規則 —— 全片貫穿
* 踩鈸連打 → 快速微震、掉幀、碎裂字體重組。
* 軍鼓 → 字體突然放大、畫面硬切、角色肩膀向下擊打。
* 808 低音擊中 → 低頻螢幕壓縮、短暫畫面變形、字體垂直拉伸或水平壓縮。
* 人聲關鍵詞 → 同步嘴型、下顎動作、點頭與向前手勢。
* 角色動作、字體動畫、場景變換與景別變化都必須同時擊中節拍。
▍場景切換 —— 全片貫穿
* 在多個近距離環境之間快速硬切。
* 所有場景都應保持 @Image 3 的整體氛圍,但每個鏡頭必須使用明顯不同的空間:狹窄走廊、近距離牆面、陰影門口、金屬/混凝土背景、邊緣光線、海報牆、樓梯間轉角、低矮天花板、車庫感空間、地下入口。
* 不要大型建立鏡頭或複雜的大型場景。
* 每次場景變化都必須由低音擊中、軍鼓、人聲重音或字體撞擊觸發。
▍景別切換 —— 全片貫穿
* 景別變化必須非常明顯:極致臉部特寫 → 中近景/半身 → 手部特寫 → 肩頸特寫 → 雙人近景分割畫面 → 臉部特寫 → 裁切半身鏡頭。
* 不要連續使用相同景別。
* 每次硬切都應產生明顯的攝影距離、角色朝向、背景空間與字體深度/分層變化。
* 攝影機運動可包含細微手持感、突然推進、短距離橫移、快速壓縮變焦與近距離搖擺。
* 不要將序列變成柔和或慢動作電影攝影。
▍角色規則 —— 全片貫穿
* 角色:兩位時髦偵探/兄弟。
* 保留 @Image 1 中角色的臉孔、髮型、服裝輪廓、比例、態度與整體氛圍。
* 肌膚應呈現寫實霧面、乾淨且高級的質感,具有自然毛孔與細微肌理。
* 不要油亮、過度磨皮的 AI 美顏濾鏡臉。
* 兩兄弟輪流直接面向鏡頭饒舌,展現強烈的演出能量。
▍角色演出 —— 全片貫穿
* 人聲演繹:冷冽、強勢、放鬆卻令人畏懼,具備緊湊、斷裂、重音強烈的節奏流動。
* 這不是靜態擺拍——他們正在主動演出。
* 清晰嘴型同步:嘴唇、下顎、臉部表情與呼吸必須跟隨人聲。
* 與節拍同步的動作:點頭、肩膀下沉、向前手勢、身體前傾、轉頭、轉身、靠近鏡頭,以及手指直接指向鏡頭。
▍重要限制 —— 全片貫穿
* 不要全身鏡頭。
* 不要寬幅群像鏡頭。
* 不要複雜的人群或群演場景。
* 整支影片僅使用近景、中近景、臉部特寫、手部特寫、肩頸特寫與半身鏡頭。
* 僅呈現角色的上半身、臉部、手勢、服裝質感、表情、嘴型同步與字體/平面視覺包裝。
* 無需呈現完整身體或腳部。
* 請勿包含任何參考圖片中的真實世界品牌、標誌、標題或可辨識的原始文字。
結論
撰寫 MiniMax H3 提示詞,意味著將創意概念轉化為清楚的製作簡報。
首先,定義每項參考素材的角色。接著,用一句聚焦的話概述影片。最後,依照邏輯順序描述鏡頭、動作、聲音、文字與限制條件。相較於一長串形容詞,結構完整且精簡的提示詞通常更容易測試與修改。
你可以在 WeShop AI 的 MiniMax H3 工具頁面 套用此範本,或從主要的 WeShop AI 工作區開始。設定時長、解析度或參考檔案要求前,請先查看目前介面,因為可用選項可能會有所變更。