August 12

MiniMax H3 對話與時間控制提示詞指南

實用的 MiniMax H3 提示詞指南,協助控制對話、說話者歸屬、鏡頭時間、音效與產品一致性,並附上真實 A/B 影片測試。

MiniMax H3 提示詞指南:控制對話、剪輯與時間

MiniMax H3 提示詞指南說明如何控制說話者、唇形同步、剪輯、音效及產品一致性,而非僅依賴美觀卻模糊的場景描述。

一個社群 MiniMax H3 範例,展示有導向的對話、動作、可讀取的道具、鏡頭移動與定時反應鏡頭。

開場片段來自 Reddit 使用者 GrayingGamer 分享的結構化提示詞。它指示兩位說話者、多個動作、可讀取的道具、鏡頭移動、聲音,以及約在第十秒出現的反應鏡頭。商業專案應使用已獲授權的角色、聲音、產品與品牌資產。這個範例的重要啟示在於其拍攝腳本邏輯。

為何 MiniMax H3 提示詞指南很重要

簡短提示詞可適用於單一主體與單一動作。當有多位說話者、畫外音、多個鏡頭或需定時的產品動作時,結構便會變得實用。否則,正確的聲音可能播放時,卻由錯誤的角色動嘴唇。剪輯可能過早出現,產品也可能在鏡頭之間改變。

實用的 MiniMax H3 提示詞指南應減少這類模糊性。加入更多風格形容詞,無法取代明確的說話者身分或時間軸。

選擇正確的官方 MiniMax H3 提示詞指南

MiniMax 提供兩項官方資源:

官方資源最適用於主要結構
影片提示詞撰寫指南文字生成影片、圖片生成影片、首尾幀及末幀任務integrated_multimodal_descriptionoverall_soundscapenon_diegetic_music
全參考模式指南使用獨立主體、圖片、影片、動作或音訊參考資料的任務subject_definitionsnon_diegetic_music 的六個區段

影片提示詞撰寫指南

Top of the official MiniMax H3 Video Prompt Writing Guide

全參考模式指南

Top of the official MiniMax H3 Full-Reference Mode Guide

文字或畫面主導的生成,請使用第一份 MiniMax H3 提示詞指南。當圖片定義產品、影片控制動作,或音訊控制語音傳達時,請使用全參考指南。

目前的官方語法為說話者提供穩定 ID,例如 (S1)(S2)。說話者身分與說話方式應置於 <d> 之外。只有語言與說出的文字應放在其中:

聲音清晰、自信的女性主持人 (S1) 問道:
<d>[English] 準備好進行壓力測試了嗎?</d>

對於畫外台詞,請將其標示為畫外旁白,並註明畫面中的角色嘴唇保持閉合。

可控時間軸的四項規則

  1. 指定說話者與靜默角色。 每個聲音只介紹一次,跨鏡頭維持相同 ID,並指出誰不得說話。
  2. 將剪輯放入時間軸。 從不含時間戳記的 [Shot 1] 開始。後續鏡頭請使用遞增的剪輯時間:
[Shot 1] 中景建立主持人、技術員與測試水槽的場景。
[Shot 2] At 00:04.000,鏡頭切換至手錶特寫。
[Shot 3] At 00:08.000,鏡頭切換至技術員舉起手錶。
  1. 區分語音與聲音。 將對話放在 <d> 中,實體聲音放在 overall_soundscape,僅供觀眾聽見的音樂則放在 non_diegetic_music
  2. 使腳本符合輸出長度。 若對話重疊或產品動作進行得太快,請縮短腳本或延長片段。

MiniMax H3 提示詞指南不只控制剪輯,也控制節奏。時間戳記之間的間隔,就是每個動作與台詞可使用的時間。

MiniMax H3 提示詞測試:簡短版與結構化版

我們以兩種提示詞風格測試一個手錶壓力測試概念。它需要三個鏡頭、兩位人物、三句台詞、一句男性畫外台詞、兩次剪輯,以及一只外觀一致的潛水錶。這項 MiniMax H3 提示詞指南比較是實務展示,而非正式基準測試。

主要提示詞差異如下:

控制項目簡短提示詞結構化提示詞
說話者在段落中以角色描述固定為 (S1)(S2)
畫外台詞「技術員在畫外說話」明確的畫外旁白加上閉嘴指示
剪輯以一般時間指示撰寫寫為 [Shot 2] At 00:04.000[Shot 3] At 00:08.000
聲音概括要求真實音效分為 overall_soundscapenon_diegetic_music

測試 1:簡短提示詞

簡短版本建立了令人信服的攝影棚場景,並讓手錶保持可辨識性。然而,在技術員的畫外台詞期間,女性主持人明顯動著嘴唇,彷彿在用他的聲音說話。剪輯約在 3.54 秒與 6.79 秒出現,因此最後的揭示鏡頭開始得太早。

測試 2:結構化 MiniMax H3 提示詞指南格式

結構化的 MiniMax H3 提示詞指南版本使用了說話者 ID、畫外旁白、閉嘴指示與定時鏡頭。其剪輯約在 3.92 秒與 7.88 秒出現,接近要求的四秒與八秒時間點。

未出現明顯的錯誤唇形同步。手錶佔據前景,而主持人留在背景。她的嘴部部分被遮擋,因此這並不能證明執行完全正確。儘管如此,結構化的 MiniMax H3 提示詞指南避開了測試 1 中可見的不一致問題。

結果簡短提示詞結構化提示詞
說話者歸屬男聲搭配可見的女性嘴唇動作未出現明顯的錯人唇形同步
剪輯時間約 3.54 秒與 6.79 秒約 3.92 秒與 7.88 秒
產品一致性手錶保持可辨識性手錶保持可辨識性,且特寫更突出
尚存問題可見的說話者不一致技術員襯衫上出現輕微的偽文字
簡短提示詞在 4.5 秒時結構化提示詞在 4.5 秒時
The female host visibly lip-syncs to the male off-screen voice in the brief prompt resultThe structured prompt result avoids an obvious wrong-person lip-sync during the male off-screen line

在 4.5 秒時,簡短結果顯示可見的主持人隨技術員畫外聲音動嘴唇。結構化結果避免了同樣明顯的不一致。

兩段影片看起來都具備商業應用的合理性。這項 MiniMax H3 提示詞指南測試並不表示較長的提示詞總能產生更美的畫面;它證明了正確的結構能改善控制力。

可重複使用的 MiniMax H3 提示詞指南範本

integrated_multimodal_description:
[Shot 1] 風格、構圖、產品、說話者 (S1)、動作與對話。
[Shot 2] At 00:SS.mmm,新的取景、產品動作、說話者 (S2)、
畫外或畫內傳達方式、精確對話,以及誰保持靜默。
[Shot 3] At 00:SS.mmm,最終動作、產品一致性與結尾畫面。

overall_soundscape: 依播放順序排列的環境與實體聲音。
non_diegetic_music: 僅供觀眾聽見的配樂,或 N/A。

若使用參考模式,請改為遵循第二份官方 MiniMax H3 提示詞指南。在撰寫時間軸之前,先定義每個 <Subject N><Picture N><Video N><Audio N> 所控制的內容。

商業品質檢查清單

在核准電商或社群影片前,請檢查:

  • 每句台詞均來自指定的說話者,且靜默角色不會產生錯誤唇形同步。
  • 剪輯接近要求的時間點,並為對話與產品動作保留足夠空間。
  • 產品的顏色、結構、標誌、材質與比例保持穩定。
  • 手部、臉部、反射、陰影、接觸點與可見文字皆通過審核。
  • 取景適合預定的 PDP、電商平台商品頁、Reel、TikTok 或廣告。

將提示詞轉化為 WeShop AI 工作流程

在 WeShop AI 開啟 MiniMax H3 工作流程,並選擇符合資產的輸入模式。使用文字從零建立內容、使用首幀鎖定開場構圖,或在獨立資產控制產品身分、動作或聲音時使用全參考模式。

接著依照五個步驟進行:

  1. 定義交付內容與時長。
  2. 指派說話者、參考資料及鎖定的產品細節。
  3. 撰寫符合實際節奏的 MiniMax H3 提示詞指南時間軸。
  4. 生成一個草稿並檢查控制失誤。
  5. 僅在基礎影片通過審核後,再建立行銷活動變體。

對於對話廣告、示範影片、說明影片及多角色影片,這份 MiniMax H3 提示詞指南的教訓很簡單:更多細節不會自動產生更漂亮的影片;正確的細節才能產生更可控的影片。

編輯註:發布任何第三方影片素材、角色肖像或聲音參考資料前,請先確認已取得授權。