WeShop AIWeShop AI
scroll left

AI 圖片

特效

AI 影片

計劃和定價

20% OFF

解決方案

資源

下載

Affiliate

API

scroll right
登錄
資源
探索幫助您更快完成工作的指南和技巧。
blog
部落格
blog
FAQ
feature request
功能請求
jobs
Jobs
app image
隨時隨地使用 WeShop AI 創作
隨時隨地釋放你的創造力。無論是在路上,還是在辦公桌前,只需下載WeShop AI,就能將靈感轉化為令人驚艷的設計。它強大而靈活,始終伴你左右。
August 11

MiniMax H3 提示詞指南:公式、分鏡、範本與常見錯誤

了解如何為 MiniMax H3 撰寫多模態參考、圖生影片、文生影片、分鏡、對白、聲音與畫面文字提示詞。

有效的 AI 影片提示詞不需要幾十個形容詞,也不需要專業劇本的格式。它需要回答三個實際問題:

  1. 每項參考素材分別扮演什麼角色?
  2. 影片的核心概念是什麼?
  3. 視覺與聲音應如何隨時間發展?

在 MiniMax H3 中使用文字、圖片、影片和音訊參考時,你可以用簡單公式來組織這些指示:

完整提示詞 = 參考素材指示 + 核心概念 + 視覺序列

若專案需要更強的連續性、產品一致性或複雜的鏡頭運動,可在最後加入一致性要求與排除項目。

第 1 部分:定義每項參考素材的角色

上傳參考檔案時,請先說明每項素材應控制什麼。不要假設模型會自動識別它們之間預期的關係。

常見的參考角色包括:

  • 角色參考: 定義臉部、髮型、服裝與整體外觀。
  • 物件參考: 定義產品或道具。
  • 場景參考: 定義環境、空間配置與燈光。
  • 第一幀或最後一幀: 建立影片應如何開始或結束。
  • 風格參考: 引導色彩、質感與視覺語言。
  • 構圖參考: 引導主體位置與視覺關係。
  • 動作參考: 提供人物或物件的動作。
  • 鏡頭參考: 提供攝影機運動模式。
  • 聲音參考: 引導角色聲線。
  • 音訊重用: 使用上傳音軌的全部或部分內容。
  • 影片剪輯參考: 指定在現有影片中要新增、移除或修改的元素。

參考素材區塊可以如下所示:

@Image1 提供女主角的臉部、髮型與服裝。
@Image2 提供黑暗城堡與清晨逆光。
@Video1 提供舞蹈動作。
@Audio1 提供音樂節奏與整體情緒。

若某項特徵必須保持一致,請直接說明此要求:

保持 @Image1 中角色的臉部特徵、銀色髮型與白色刺繡服裝一致。

第 2 部分:定義影片核心概念

核心概念應以一句話概述整支影片。至少包含:

  1. 主體: 出現的是誰或什麼。
  2. 地點: 場景發生在哪裡。
  3. 事件: 主體做什麼。
  4. 形式與風格: 廣告、電影、動畫、紀錄片或其他處理方式。
  5. 鏡頭規則: 一鏡到底、快速剪輯、空拍畫面或其他方式。

例如:

一位外觀遵循 @Image1 的年輕女性,在 @Image2 的櫻花庭院中
表演 @Video1 的劍舞動作。採用寫實電影感的中國古裝風格,
並將整段內容呈現為一鏡到底。

請讓這段說明保持精簡。若核心概念包含多個無關的角色、地點或故事線,即使有詳細的鏡頭指示,結果仍可能難以維持連貫。

第 3 部分:描述視覺序列

你可以依時間區間或鏡頭來安排視覺序列。每個段落都應說明重要元素:

  • 鏡頭景別;
  • 主體與動作;
  • 攝影機運動;
  • 對白或旁白;
  • 環境音、音樂與關鍵音效;
  • 必須出現的畫面文字;
  • 不應出現的元素。

例如:

0–3 秒:全景。女性從左側進入櫻花庭院。
背景柔和失焦。只使用腳步聲與風吹樹葉的聲音。
無對白。

3–8 秒:切換至中景。她拔出劍並採取起始姿勢,
遵循 @Video1 的動作。櫻花落下時,攝影機緩慢向前推進。

8–12 秒:特寫。劍光閃現,動作放慢,劍身將
飄落的花瓣推向兩側。

12–15 秒:回到全景。她完成整段動作,放下劍,
並望向攝影機。
非敘事內音樂:無。請勿加入背景音樂。

此結構可建立動作、攝影機運動與聲音之間清楚的關係,也讓個別鏡頭更容易修改。

如何為三種生成模式撰寫 MiniMax H3 提示詞

1. 多模態參考生成

同時上傳角色、動作、場景與音訊參考時,請為每個檔案分配明確職責。

@Image1 是角色參考。保持女主角的臉部與服裝一致。
@Image2 是背景參考。
@Video1 是動作參考。使用劍舞動作。
@Audio1 是音樂與情緒參考。
呈現女主角在清晨的黑暗城堡中表演所參考的動作。
讓剪輯時間點對齊音樂中的主要節拍。

避免上傳參考素材卻不說明其使用方式。影片可能同時包含動作、鏡頭運動、剪輯與聲音,因此請指出哪些元素對結果最重要。

20260811_1_fb52dea0-3c41-4a77-809b-152a480584ae_1255x294.png

screenshot-20260811-102227.png Clipboard_Screenshot_1785318067.png

2. 圖生影片提示詞

使用一張圖片時,請說明它是第一幀、角色參考,還是一般視覺參考。使用兩張圖片時,請定義起始幀與結束幀之間的關係。

@Image1 是第一幀:一名女性手持劍站在櫻花樹下。
讓她從起始姿勢動態演出至劍舞序列結束。
使用一鏡到底,不要切鏡。
保持角色、服裝與庭院構圖一致。

第一幀與最後一幀的工作流程,主要需要描述連接兩幀的動作、燈光與聲音。若希望加入額外切鏡,請明確提出要求。 screenshot-20260811-122439.png

任务-66803765-1-4.png

3. 文生影片提示詞

沒有參考素材時,請更詳細描述主體、場景、動作、視覺風格、攝影機與聲音。

15 秒,16:9,寫實自然紀錄片風格。
黎明時分的霧氣濕地中,一隻成年白鶴單腳站在淺水裡,
並緩慢將頭轉向攝影機。
柔和的逆光穿過霧氣,細小漣漪在水面上擴散。
攝影機從超廣角全景緩慢推進至中景,中間不切鏡。
只使用風聲、水聲與遠方鳥鳴。請勿加入背景音樂。

相較於「生成一隻站在水中的白鶴」,此版本定義了時長、長寬比、主體、環境、燈光、動作、鏡頭方向與聲音。 screenshot-20260811-124118.png

應該如何拆分鏡頭?

使用切點,而非每秒加入一個新動作

MiniMax H3 提示詞可圍繞鏡頭與切點來安排。在每個鏡頭內,請保留一個主要動作。切鏡後,必要時重新說明主體、景別與空間關係。

不需要每秒引入不同的動作。過於密集的指示可能彼此衝突,並模糊主要事件。

讓對白長度符合鏡頭時長

三秒鐘的鏡頭無法自然容納一段很長的台詞。請先朗讀對白並估算時長,再將其分配至鏡頭中。

若對白跨越切鏡,請描述 J-cut 或 L-cut:

  • J-cut: 下一個鏡頭的音訊在視覺切鏡之前開始。
  • L-cut: 前一個鏡頭的音訊在畫面切換後持續播放。

範例:

鏡頭 1:畫外音說:「起床,起床。」

鏡頭 2:切換至一名中年女性的特寫。她是前一鏡頭的說話者,
並接著說:「該去上學了。」

不要混用一鏡到底與多鏡頭結構

若要求一鏡到底,請描述單一連續空間中的運動。不要同時要求多個鏡頭、硬切或地點之間的突然跳轉。

若影片需要多個場景,請移除一鏡到底的指示,並清楚定義每個切點。

如何控制聲音與畫面文字

分開處理不同類型的聲音

將聲音視為數個不同層次:

  • 角色對白;
  • 旁白;
  • 環境音;
  • 動作音效;
  • 非敘事內音樂。

若不希望有背景音樂,請寫:

非敘事內音樂:無。
請勿加入背景音樂。

避免一邊要求模型重用音樂,一邊又要求不要背景音樂。若想保留環境音但移除音樂,請清楚區分兩者。

寫出精確的畫面文字

若影片需要標題、標誌、標語或按鈕,請加入確切文字:

手機螢幕上的標題顯示:「AI Video Creation。」
按鈕文字顯示:「Start Now。」

你也可以控制位置、出現頻率與動畫:

標題只在畫面中央出現一次。
淡入後停留兩秒,且不要重複出現。

請務必手動檢查生成的文字、標誌與介面元素。AI 生成影片可能會拼錯、扭曲、重複或變更這些細節。

以可見動作取代隱喻

「孤獨如潮水般湧起」表達的是情緒,但並未定義可見場景。

請將感受轉化為動作、構圖、燈光、空間與聲音:

一個人獨自站在空曠鐵路月台的中央。
攝影機緩慢拉遠。駛離列車的燈光在遠方消失,
只留下雨聲與車站廣播的回音。

具體的視覺指示通常比抽象的情緒語言提供更多控制力。

常見 MiniMax H3 提示詞錯誤與修正方式

常見錯誤建議修正方式
將所有內容寫成一大段文字分開說明參考素材、核心概念與鏡頭序列
上傳素材卻未定義用途為每個檔案分配角色、動作、場景、構圖或聲音角色
包含互相矛盾的指示移除衝突的鏡頭、聲音或風格要求
要求一鏡到底與多次切鏡將序列改寫為連續運動,或移除一鏡到底規則
未提供角色參考圖卻期待相同臉孔上傳角色圖片,並指出要保留的特徵
文生影片提示詞過短加入主體、場景、動作、鏡頭、燈光與聲音
僅使用抽象風格語言將其轉換為可見的色彩、質感、燈光與構圖
在短鏡頭中塞入太多對白縮短台詞或增加鏡頭時長
同時要求保留與移除音樂分開描述環境音、音效與非敘事內音樂
為多個參考素材分配重疊職責定義每項素材的主要角色

可直接複製的 MiniMax H3 提示詞範本

[參考素材指示]
@Image1:角色參考。保持 ________ 一致。
@Image2:產品/場景參考。保持 ________ 一致。
@Video1:動作/鏡頭/剪輯參考。使用 ________。
@Audio1:聲音/音樂/節奏參考。使用 ________。

[核心概念]
時長:____ 秒。長寬比:____。
主體 ________ 在 ________ 中進行 ________。
使用 ________ 視覺風格與 ________ 鏡頭規則。

[視覺序列]
0–__ 秒:景別 ________;畫面 ________;動作 ________;
攝影機運動 ________;聲音 ________。

__–__ 秒:景別 ________;畫面 ________;動作 ________;
攝影機運動 ________;聲音 ________。

__–__ 秒:景別 ________;畫面 ________;動作 ________;
攝影機運動 ________;聲音 ________。

[文字與聲音]
必要畫面文字:「________。」
角色 ________ 說:「________。」
環境音:________。
非敘事內音樂:________。

[一致性要求與排除項目]
保持 ________ 一致。
不要包含 ________。
pasted-1785391007599.png 迷你马克斯.png 纯净场景.png
【參考素材指南】
@Image 3:場景視覺風格——街道/夜晚/地下空間、幽閉構圖、環境景深、膠片顆粒。
@Image 2:字體與平面視覺包裝——字體質感、平面設計、動態字體、強烈動態圖形衝擊力。
@Image 1:角色外觀——臉孔、髮型、服裝輪廓、身體比例、態度與整體氛圍。

僅參考指定的維度。請勿直接複製參考圖片。請勿包含原始參考圖片中的真實世界品牌、標誌、標題或可辨識文字。

【核心概念】
一支 10 秒、16:9 橫向的 trap 音樂錄影帶。兩位時髦的偵探兄弟直接面向鏡頭演出,在多個狹窄的地下場景中輪流饒舌。整支影片隨著 trap 節拍推進,使用與節拍同步的硬切。每次低音擊中時,高對比、印刷海報風格的英文粗體字會猛烈撞入畫面。

整體美學:地下音樂錄影帶 + 時尚雜誌拼貼 + 高級時裝編輯質感,呈現冷冽且克制的兄弟雙人演出。

【視覺序列描述】

鏡頭 1 —— 極致臉部特寫/幽閉通道

* 場景:狹窄走廊或地下入口,以近距離拍攝,參考 @Image 3。
* 構圖:臉部極致特寫——臉/眼睛/頸部與肩膀/部分領口細節。
* 角色:偵探 A 直視鏡頭並開始饒舌,表情冷靜但銳利。
* 字體:巨大的粗體英文文字「TWO FLY」推入畫面上方與下方,且不遮擋眼睛。
* 節奏:在 808 低音擊中時,「TWO FLY」立即垂直壓縮,接著彈回。踩鈸連打時,字母邊緣以細微的碎裂動態快速震動。在重讀的「fly」一詞時,觸發掃描線位移/故障效果。
* 硬切。

鏡頭 2 —— 中近景/字體牆背景

* 場景:不同的牆面或覆滿海報的牆面,以近距離拍攝,視覺上與鏡頭 1 明顯不同。
* 構圖:明確拉遠至中近景/半身構圖。
* 角色:偵探 B 直接面向鏡頭饒舌。他的肩膀與頭部隨踩鈸節奏律動,身體微微前傾。
* 字體:巨大的濃縮英文文字「CLUES」位於角色後方,自然地被髮型、肩膀與服裝輪廓遮擋。
* 節奏:字體如同海報豎起般垂直拉伸。每次軍鼓聲響起時,文字突然放大、震動並產生掃描線位移。
* 硬切。

鏡頭 3 —— 手部特寫/遮擋轉場

* 場景:金屬門邊緣/欄杆/車庫牆面/低矮天花板的一段區域。
* 構圖:聚焦於手部、戒指、袖口與服裝質感的特寫。
* 角色:偵探 A 將手勢推向鏡頭,如同遞出一條線索。他的臉部在背景中保持模糊或部分可見。
* 字體:垂直的「BROTHERS」出現在前景一側,並短暫被手遮擋。
* 節奏:在「move as one」這句時,字體拉伸成一條長長的垂直字帶,接著在低音擊中時硬切並重組。
* 硬切。

鏡頭 4 —— 肩頸特寫至臉部特寫/樓梯間轉角

* 場景:樓梯間轉角/陰影中的門口/低矮通道。
* 構圖:從肩膀、頸部、領口與服裝質感的特寫開始 → 在軍鼓聲響起時突然推進為臉部特寫。
* 角色:偵探 B 轉頭並在持續饒舌時靠近鏡頭。
* 字體:「AS ONE」如時尚雜誌標題般爆發出現,並隨節拍突然放大。
* 節奏:推進過程中,字體突然硬切為新的版面配置。絕不可遮擋眼睛。
* 硬切。

鏡頭 5 —— 帶動態殘影的半身近景/車庫或混凝土背景

* 場景:車庫感空間或混凝土背景。
* 構圖:偵探 A 的半身近景。
* 角色:主圖層具有清晰且精準同步的嘴型動作。次圖層創造動態殘影——影印機風格的位移/幀延遲——同時保持臉部結構完整且不失真。他的手勢橫向���過鏡頭。
* 字體:垂直的「CUT GOLD」以掉幀動畫在背景中閃爍。
* 節奏:在「CUT」時,畫面立即被水平切開,觸發白閃硬切。「GOLD」壓縮為厚重的字體方塊,接著突然回彈。
* 硬切。

鏡頭 6 —— 雙人近景分割畫面/色塊分區

* 場景:地下入口/牆面/欄杆/門框,在視覺上與鏡頭 5 明顯不同。
* 構圖:畫面分為兩至三個色塊區域。透過快速硬切,在兩位偵探的臉部特寫與裁切半身細節之間交替。
* 角色:兩位偵探在左、右兩側輪流演出。
* 字體:中央出現粗體文字:「CASE COMPLETE」。
* 節奏:每次 808 低音擊中時,構圖透過硬切重組。字母先壓扁,隨即拉伸。踩鈸連打時,碎裂字體快速跳動。在最後一個重拍,觸發掃描位移結合撕紙風格的震動。
* 硬切。

結尾 —— 多場景近景演出蒙太奇

* 場景:在狹窄走廊中的臉部特寫、靠牆的中近景、手部特寫、樓梯間轉角的肩頸特寫、車庫環境中的裁切半身鏡頭,以及陰影門口中的雙人近景之間快速交替。
* 構圖:不使用全身鏡頭與寬幅群像鏡頭。僅使用近景、中近景、臉部特寫、手部特寫、肩頸特寫與半身鏡頭。
* 角色:兩位偵探輪流直接面向鏡頭饒舌。嘴型、下顎動作、呼吸、眉眼與手勢必須精確對齊人聲、軍鼓、踩鈸連打與低音擊中。
* 字體:最終主標文字「CASE CLOSED」以巨大力度撞入畫面。
* 節奏:每次低音擊中都觸發場景硬切或突兀的景別變化。每次軍鼓聲都觸發字體撞擊或圖層位移。最後一拍時,不同場景的所有碎片同時定格,接著硬切至黑畫面。

【額外整體要求】

▍視覺風格 —— 全片貫穿

* 厚重顆粒、細微膠片抖動、影印紙張質感、半調網點、粗糙印刷邊緣、掃描位移、掉幀動態殘影,以及高速圖層錯位。
* 極快速剪輯。僅使用硬切、跳切、節拍切、遮擋切、白閃硬切及由字體驅動的硬切。
* 不要淡出、不要疊化,也不要柔和轉場。

▍字體/平面視覺包裝 —— 全片貫穿

* 字體必須作為畫面整合的一部分,並具備可信的空間分層。
* 相對於角色,文字可存在於前景、中景或背景。
* 角色可以遮擋字體,字體也可以覆蓋角色的部分區域,但絕不可遮擋眼睛或關鍵臉部表情。
* 字體必須透過出現、震動、拉伸、壓縮、位移、撕裂與硬切重組,回應人聲重音、軍鼓、踩鈸連打與 808 低音擊中。
* 風格:厚重濃縮無襯線字體、巨型英文粗體字、垂直拉伸、水平壓縮、垂直排列英文文字、弧形標題、高對比黑/白/紅、影印紙張顆粒、半調網點、破損印刷、掃描位移與小誌拼貼美學。
* 保持字體數量克制:每個鏡頭僅一個主要文字元素,最多少量編號。不要密集小字與標誌。

▍節奏規則 —— 全片貫穿

* 踩鈸連打 → 快速微震、掉幀、碎裂字體重組。
* 軍鼓 → 字體突然放大、畫面硬切、角色肩膀向下擊打。
* 808 低音擊中 → 低頻螢幕壓縮、短暫畫面變形、字體垂直拉伸或水平壓縮。
* 人聲關鍵詞 → 同步嘴型、下顎動作、點頭與向前手勢。
* 角色動作、字體動畫、場景變換與景別變化都必須同時擊中節拍。

▍場景切換 —— 全片貫穿

* 在多個近距離環境之間快速硬切。
* 所有場景都應保持 @Image 3 的整體氛圍,但每個鏡頭必須使用明顯不同的空間:狹窄走廊、近距離牆面、陰影門口、金屬/混凝土背景、邊緣光線、海報牆、樓梯間轉角、低矮天花板、車庫感空間、地下入口。
* 不要大型建立鏡頭或複雜的大型場景。
* 每次場景變化都必須由低音擊中、軍鼓、人聲重音或字體撞擊觸發。

▍景別切換 —— 全片貫穿

* 景別變化必須非常明顯:極致臉部特寫 → 中近景/半身 → 手部特寫 → 肩頸特寫 → 雙人近景分割畫面 → 臉部特寫 → 裁切半身鏡頭。
* 不要連續使用相同景別。
* 每次硬切都應產生明顯的攝影距離、角色朝向、背景空間與字體深度/分層變化。
* 攝影機運動可包含細微手持感、突然推進、短距離橫移、快速壓縮變焦與近距離搖擺。
* 不要將序列變成柔和或慢動作電影攝影。

▍角色規則 —— 全片貫穿

* 角色:兩位時髦偵探/兄弟。
* 保留 @Image 1 中角色的臉孔、髮型、服裝輪廓、比例、態度與整體氛圍。
* 肌膚應呈現寫實霧面、乾淨且高級的質感,具有自然毛孔與細微肌理。
* 不要油亮、過度磨皮的 AI 美顏濾鏡臉。
* 兩兄弟輪流直接面向鏡頭饒舌,展現強烈的演出能量。

▍角色演出 —— 全片貫穿

* 人聲演繹:冷冽、強勢、放鬆卻令人畏懼,具備緊湊、斷裂、重音強烈的節奏流動。
* 這不是靜態擺拍——他們正在主動演出。
* 清晰嘴型同步:嘴唇、下顎、臉部表情與呼吸必須跟隨人聲。
* 與節拍同步的動作:點頭、肩膀下沉、向前手勢、身體前傾、轉頭、轉身、靠近鏡頭,以及手指直接指向鏡頭。

▍重要限制 —— 全片貫穿

* 不要全身鏡頭。
* 不要寬幅群像鏡頭。
* 不要複雜的人群或群演場景。
* 整支影片僅使用近景、中近景、臉部特寫、手部特寫、肩頸特寫與半身鏡頭。
* 僅呈現角色的上半身、臉部、手勢、服裝質感、表情、嘴型同步與字體/平面視覺包裝。
* 無需呈現完整身體或腳部。
* 請勿包含任何參考圖片中的真實世界品牌、標誌、標題或可辨識的原始文字。

結論

撰寫 MiniMax H3 提示詞,意味著將創意概念轉化為清楚的製作簡報。

首先,定義每項參考素材的角色。接著,用一句聚焦的話概述影片。最後,依照邏輯順序描述鏡頭、動作、聲音、文字與限制條件。相較於一長串形容詞,結構完整且精簡的提示詞通常更容易測試與修改。

你可以在 WeShop AI 的 MiniMax H3 工具頁面 套用此範本,或從主要的 WeShop AI 工作區開始。設定時長、解析度或參考檔案要求前,請先查看目前介面,因為可用選項可能會有所變更。