MiniMax H3 對話與時間控制提示詞指南
實用的 MiniMax H3 提示詞指南,協助控制對話、說話者歸屬、鏡頭時間、音效與產品一致性,並附上真實 A/B 影片測試。
MiniMax H3 提示詞指南:控制對話、剪輯與時間
本 MiniMax H3 提示詞指南說明如何控制說話者、唇形同步、剪輯、音效及產品一致性,而非僅依賴美觀卻模糊的場景描述。
一個社群 MiniMax H3 範例,展示有導向的對話、動作、可讀取的道具、鏡頭移動與定時反應鏡頭。
開場片段來自 Reddit 使用者 GrayingGamer 分享的結構化提示詞。它指示兩位說話者、多個動作、可讀取的道具、鏡頭移動、聲音,以及約在第十秒出現的反應鏡頭。商業專案應使用已獲授權的角色、聲音、產品與品牌資產。這個範例的重要啟示在於其拍攝腳本邏輯。
為何 MiniMax H3 提示詞指南很重要
簡短提示詞可適用於單一主體與單一動作。當有多位說話者、畫外音、多個鏡頭或需定時的產品動作時,結構便會變得實用。否則,正確的聲音可能播放時,卻由錯誤的角色動嘴唇。剪輯可能過早出現,產品也可能在鏡頭之間改變。
實用的 MiniMax H3 提示詞指南應減少這類模糊性。加入更多風格形容詞,無法取代明確的說話者身分或時間軸。
選擇正確的官方 MiniMax H3 提示詞指南
MiniMax 提供兩項官方資源:
| 官方資源 | 最適用於 | 主要結構 |
|---|---|---|
| 影片提示詞撰寫指南 | 文字生成影片、圖片生成影片、首尾幀及末幀任務 | integrated_multimodal_description、overall_soundscape、non_diegetic_music |
| 全參考模式指南 | 使用獨立主體、圖片、影片、動作或音訊參考資料的任務 | 從 subject_definitions 到 non_diegetic_music 的六個區段 |
影片提示詞撰寫指南

全參考模式指南

文字或畫面主導的生成,請使用第一份 MiniMax H3 提示詞指南。當圖片定義產品、影片控制動作,或音訊控制語音傳達時,請使用全參考指南。
目前的官方語法為說話者提供穩定 ID,例如 (S1) 與 (S2)。說話者身分與說話方式應置於 <d> 之外。只有語言與說出的文字應放在其中:
聲音清晰、自信的女性主持人 (S1) 問道:
<d>[English] 準備好進行壓力測試了嗎?</d>
對於畫外台詞,請將其標示為畫外旁白,並註明畫面中的角色嘴唇保持閉合。
可控時間軸的四項規則
- 指定說話者與靜默角色。 每個聲音只介紹一次,跨鏡頭維持相同 ID,並指出誰不得說話。
- 將剪輯放入時間軸。 從不含時間戳記的
[Shot 1]開始。後續鏡頭請使用遞增的剪輯時間:
[Shot 1] 中景建立主持人、技術員與測試水槽的場景。
[Shot 2] At 00:04.000,鏡頭切換至手錶特寫。
[Shot 3] At 00:08.000,鏡頭切換至技術員舉起手錶。
- 區分語音與聲音。 將對話放在
<d>中,實體聲音放在overall_soundscape,僅供觀眾聽見的音樂則放在non_diegetic_music。 - 使腳本符合輸出長度。 若對話重疊或產品動作進行得太快,請縮短腳本或延長片段。
本 MiniMax H3 提示詞指南不只控制剪輯,也控制節奏。時間戳記之間的間隔,就是每個動作與台詞可使用的時間。
MiniMax H3 提示詞測試:簡短版與結構化版
我們以兩種提示詞風格測試一個手錶壓力測試概念。它需要三個鏡頭、兩位人物、三句台詞、一句男性畫外台詞、兩次剪輯,以及一只外觀一致的潛水錶。這項 MiniMax H3 提示詞指南比較是實務展示,而非正式基準測試。
主要提示詞差異如下:
| 控制項目 | 簡短提示詞 | 結構化提示詞 |
|---|---|---|
| 說話者 | 在段落中以角色描述 | 固定為 (S1) 與 (S2) |
| 畫外台詞 | 「技術員在畫外說話」 | 明確的畫外旁白加上閉嘴指示 |
| 剪輯 | 以一般時間指示撰寫 | 寫為 [Shot 2] At 00:04.000 與 [Shot 3] At 00:08.000 |
| 聲音 | 概括要求真實音效 | 分為 overall_soundscape 與 non_diegetic_music |
測試 1:簡短提示詞
簡短版本建立了令人信服的攝影棚場景,並讓手錶保持可辨識性。然而,在技術員的畫外台詞期間,女性主持人明顯動著嘴唇,彷彿在用他的聲音說話。剪輯約在 3.54 秒與 6.79 秒出現,因此最後的揭示鏡頭開始得太早。
測試 2:結構化 MiniMax H3 提示詞指南格式
結構化的 MiniMax H3 提示詞指南版本使用了說話者 ID、畫外旁白、閉嘴指示與定時鏡頭。其剪輯約在 3.92 秒與 7.88 秒出現,接近要求的四秒與八秒時間點。
未出現明顯的錯誤唇形同步。手錶佔據前景,而主持人留在背景。她的嘴部部分被遮擋,因此這並不能證明執行完全正確。儘管如此,結構化的 MiniMax H3 提示詞指南避開了測試 1 中可見的不一致問題。
| 結果 | 簡短提示詞 | 結構化提示詞 |
|---|---|---|
| 說話者歸屬 | 男聲搭配可見的女性嘴唇動作 | 未出現明顯的錯人唇形同步 |
| 剪輯時間 | 約 3.54 秒與 6.79 秒 | 約 3.92 秒與 7.88 秒 |
| 產品一致性 | 手錶保持可辨識性 | 手錶保持可辨識性,且特寫更突出 |
| 尚存問題 | 可見的說話者不一致 | 技術員襯衫上出現輕微的偽文字 |
| 簡短提示詞在 4.5 秒時 | 結構化提示詞在 4.5 秒時 |
|---|---|
![]() | ![]() |
在 4.5 秒時,簡短結果顯示可見的主持人隨技術員畫外聲音動嘴唇。結構化結果避免了同樣明顯的不一致。
兩段影片看起來都具備商業應用的合理性。這項 MiniMax H3 提示詞指南測試並不表示較長的提示詞總能產生更美的畫面;它證明了正確的結構能改善控制力。
可重複使用的 MiniMax H3 提示詞指南範本
integrated_multimodal_description:
[Shot 1] 風格、構圖、產品、說話者 (S1)、動作與對話。
[Shot 2] At 00:SS.mmm,新的取景、產品動作、說話者 (S2)、
畫外或畫內傳達方式、精確對話,以及誰保持靜默。
[Shot 3] At 00:SS.mmm,最終動作、產品一致性與結尾畫面。
overall_soundscape: 依播放順序排列的環境與實體聲音。
non_diegetic_music: 僅供觀眾聽見的配樂,或 N/A。
若使用參考模式,請改為遵循第二份官方 MiniMax H3 提示詞指南。在撰寫時間軸之前,先定義每個 <Subject N>、<Picture N>、<Video N> 或 <Audio N> 所控制的內容。
商業品質檢查清單
在核准電商或社群影片前,請檢查:
- 每句台詞均來自指定的說話者,且靜默角色不會產生錯誤唇形同步。
- 剪輯接近要求的時間點,並為對話與產品動作保留足夠空間。
- 產品的顏色、結構、標誌、材質與比例保持穩定。
- 手部、臉部、反射、陰影、接觸點與可見文字皆通過審核。
- 取景適合預定的 PDP、電商平台商品頁、Reel、TikTok 或廣告。
將提示詞轉化為 WeShop AI 工作流程
在 WeShop AI 開啟 MiniMax H3 工作流程,並選擇符合資產的輸入模式。使用文字從零建立內容、使用首幀鎖定開場構圖,或在獨立資產控制產品身分、動作或聲音時使用全參考模式。
接著依照五個步驟進行:
- 定義交付內容與時長。
- 指派說話者、參考資料及鎖定的產品細節。
- 撰寫符合實際節奏的 MiniMax H3 提示詞指南時間軸。
- 生成一個草稿並檢查控制失誤。
- 僅在基礎影片通過審核後,再建立行銷活動變體。
對於對話廣告、示範影片、說明影片及多角色影片,這份 MiniMax H3 提示詞指南的教訓很簡單:更多細節不會自動產生更漂亮的影片;正確的細節才能產生更可控的影片。
編輯註:發布任何第三方影片素材、角色肖像或聲音參考資料前,請先確認已取得授權。

