MiniMax H3 Prompt-Leitfaden für Dialoge und Timing
Ein praktischer MiniMax H3 Prompt-Leitfaden zur Steuerung von Dialogen, Sprecherzuordnung, Shot-Timing, Sound und Produktkontinuität – mit einem echten A/B-Videotest.
MiniMax H3 Prompt-Leitfaden: Dialoge, Schnitte und Timing steuern
Dieser MiniMax H3 Prompt-Leitfaden zeigt, wie Sie Sprecher, Lippensynchronität, Schnitte, Sound und Produktkontinuität steuern, statt sich auf eine gut aussehende, aber mehrdeutige Szenenbeschreibung zu verlassen.
Ein MiniMax H3 Community-Beispiel mit gesteuerten Dialogen, Aktionen, einem lesbaren Requisit, Kamerabewegung und einer zeitlich abgestimmten Reaktionsaufnahme.
Der Eröffnungsclip stammt aus einem strukturierten Prompt, den der Reddit-Nutzer GrayingGamer geteilt hat. Er steuert zwei Sprecher, mehrere Aktionen, ein lesbares Requisit, Kamerabewegung, Sound und eine Reaktionsaufnahme nach etwa zehn Sekunden. Kommerzielle Projekte sollten autorisierte Charaktere, Stimmen, Produkte und Marken-Assets verwenden. Die hilfreiche Erkenntnis liegt in der Logik des Drehbuchs.
Warum ein MiniMax H3 Prompt-Leitfaden wichtig ist
Ein kurzer Prompt kann für ein Subjekt und eine Aktion funktionieren. Bei mehreren Sprechern, einer Off-Screen-Stimme, mehreren Shots oder zeitlich abgestimmten Produktaktionen wird Struktur nützlich. Andernfalls kann die richtige Stimme laufen, während die falsche Figur ihre Lippen bewegt. Schnitte können zu früh erfolgen und Produkte sich zwischen den Shots verändern.
Ein praktischer MiniMax H3 Prompt-Leitfaden sollte diese Mehrdeutigkeit reduzieren. Mehr Stiladjektive können keine klare Sprecheridentität oder Zeitleiste ersetzen.
Den richtigen offiziellen MiniMax H3 Prompt-Leitfaden wählen
MiniMax bietet zwei offizielle Ressourcen:
| Offizielle Ressource | Am besten geeignet für | Hauptstruktur |
|---|---|---|
| Leitfaden zum Schreiben von Video-Prompts | Text-zu-Video, Bild-zu-Video, Aufgaben mit erstem und letztem Frame sowie letztem Frame | integrated_multimodal_description, overall_soundscape, non_diegetic_music |
| Leitfaden zum Full-Reference-Modus | Aufgaben mit separaten Referenzen für Subjekte, Bilder, Videos, Bewegungen oder Audio | Sechs Abschnitte von subject_definitions bis non_diegetic_music |
Leitfaden zum Schreiben von Video-Prompts

Leitfaden zum Full-Reference-Modus

Verwenden Sie den ersten MiniMax H3 Prompt-Leitfaden für text- oder framebasierte Generierung. Nutzen Sie den Full-Reference-Leitfaden, wenn ein Bild das Produkt definiert, ein Video die Bewegung steuert oder Audio die Stimmwiedergabe bestimmt.
Die aktuelle offizielle Syntax verwendet stabile IDs für Sprecher wie (S1) und (S2). Sprecheridentität und Sprechweise bleiben außerhalb von <d>. Nur Sprache und gesprochene Worte gehören hinein:
Die Moderatorin mit klarer, selbstbewusster Stimme (S1) fragt:
<d>[English] Bereit für den Drucktest?</d>
Bei einer Off-Screen-Zeile identifizieren Sie sie als Off-Screen-Voice-over und geben an, dass die Lippen der sichtbaren Figur geschlossen bleiben.
Vier Regeln für eine steuerbare Zeitleiste
- Sprecher und Stille zuweisen. Führen Sie jede Stimme einmal ein, behalten Sie dieselbe ID über alle Shots hinweg bei und benennen Sie, wer nicht sprechen darf.
- Schnitte auf der Zeitleiste platzieren. Beginnen Sie mit
[Shot 1]und ohne Zeitstempel. Geben Sie späteren Shots aufsteigende Schnittzeiten:
[Shot 1] Eine Halbtotalenaufnahme etabliert Moderatorin, Techniker und Testtank.
[Shot 2] At 00:04.000, die Kamera schneidet auf eine Nahaufnahme der Uhr.
[Shot 3] At 00:08.000, die Kamera schneidet zum Techniker, der die Uhr anhebt.
- Sprache und Sound trennen. Platzieren Sie Dialoge in
<d>, physische Geräusche inoverall_soundscapeund nur für das Publikum hörbare Musik innon_diegetic_music. - Das Skript an die Ausgabelänge anpassen. Wenn Dialoge überlappen oder eine Produktaktion zu schnell abläuft, kürzen Sie das Skript oder verlängern Sie den Clip.
Dieser MiniMax H3 Prompt-Leitfaden steuert sowohl das Tempo als auch den Schnitt. Der Abstand zwischen Zeitstempeln ist die verfügbare Zeit für jede Aktion und Zeile.
MiniMax H3 Prompt-Test: Kurz vs. strukturiert
Wir haben ein Uhren-Drucktestkonzept mit zwei Prompt-Stilen getestet. Es erforderte drei Shots, zwei Personen, drei Zeilen, eine männliche Off-Screen-Zeile, zwei Schnitte und eine konsistente Taucheruhr. Dieser Vergleich im MiniMax H3 Prompt-Leitfaden ist eine praktische Demonstration, kein formaler Benchmark.
Die wichtigsten Prompt-Unterschiede waren:
| Steuerung | Kurzer Prompt | Strukturierter Prompt |
|---|---|---|
| Sprecher | In Absätzen nach Rolle beschrieben | Festgelegt als (S1) und (S2) |
| Off-Screen-Zeile | „Der Techniker spricht off-screen“ | Explizites Off-Screen-Voice-over plus Anweisung für geschlossenen Mund |
| Schnitte | Als normale Zeitangaben geschrieben | Als [Shot 2] At 00:04.000 und [Shot 3] At 00:08.000 geschrieben |
| Sound | Allgemeine Anforderung an realistischen Sound | Getrennt in overall_soundscape und non_diegetic_music |
Test 1: Kurzer Prompt
Die kurze Version erzeugte ein überzeugendes Studio und hielt die Uhr erkennbar. Während der Off-Screen-Zeile des Technikers bewegte die Moderatorin jedoch sichtbar ihre Lippen, als würde sie mit seiner Stimme sprechen. Die Schnitte kamen ungefähr bei 3,54 und 6,79 Sekunden, sodass die finale Enthüllung zu früh begann.
Test 2: Strukturierter MiniMax H3 Prompt-Leitfaden
Die strukturierte Version des MiniMax H3 Prompt-Leitfadens verwendete Sprecher-IDs, ein Off-Screen-Voice-over, eine Anweisung für geschlossenen Mund und zeitlich abgestimmte Shots. Die Schnitte kamen ungefähr bei 3,92 und 7,88 Sekunden und damit nahe an den gewünschten Vier- und Acht-Sekunden-Marken.
Es zeigte sich keine offensichtliche falsche Lippensynchronität. Die Uhr füllte den Vordergrund, während die Moderatorin im Hintergrund blieb. Ihr Mund war teilweise verdeckt, daher beweist dies keine perfekte Ausführung. Dennoch vermied der strukturierte MiniMax H3 Prompt-Leitfaden die sichtbare Abweichung aus Test 1.
| Ergebnis | Kurzer Prompt | Strukturierter Prompt |
|---|---|---|
| Sprecherzuordnung | Männliche Stimme bei sichtbarer Lippenbewegung der Frau | Keine offensichtliche Lippensynchronität der falschen Person |
| Schnitt-Timing | Etwa 3,54 s und 6,79 s | Etwa 3,92 s und 7,88 s |
| Produktkontinuität | Uhr blieb erkennbar | Uhr blieb erkennbar mit stärkerer Nahaufnahme |
| Verbleibendes Problem | Sichtbare Sprecherabweichung | Geringfügiger Pseudotext auf dem Shirt des Technikers |
| Kurzer Prompt bei 4,5 Sekunden | Strukturierter Prompt bei 4,5 Sekunden |
|---|---|
![]() | ![]() |
Bei 4,5 Sekunden zeigt das kurze Ergebnis die sichtbare Moderatorin, die ihre Lippen zur Off-Screen-Stimme des Technikers bewegt. Das strukturierte Ergebnis vermeidet dieselbe offensichtliche Abweichung.
Beide Clips wirkten kommerziell plausibel. Dieser Test im MiniMax H3 Prompt-Leitfaden zeigt nicht, dass längere Prompts immer schönere Frames erzeugen. Er zeigt, dass die richtige Struktur die Steuerbarkeit verbessern kann.
Eine wiederverwendbare Vorlage für den MiniMax H3 Prompt-Leitfaden
integrated_multimodal_description:
[Shot 1] Stil, Komposition, Produkt, Sprecher (S1), Aktion und Dialog.
[Shot 2] At 00:SS.mmm, neue Bildgestaltung, Produktaktion, Sprecher (S2),
Off-Screen- oder On-Screen-Wiedergabe, exakter Dialog und wer still bleibt.
[Shot 3] At 00:SS.mmm, finale Aktion, Produktkontinuität und Endframe.
overall_soundscape: Umgebungs- und physische Geräusche in Wiedergabereihenfolge.
non_diegetic_music: Nur für das Publikum hörbare Musik oder N/A.
Befolgen Sie im Referenzmodus stattdessen den zweiten offiziellen MiniMax H3 Prompt-Leitfaden. Definieren Sie vor dem Schreiben der Zeitleiste, was jede <Subject N>, <Picture N>, <Video N> oder <Audio N> steuert.
Checkliste für kommerzielle Qualität
Prüfen Sie vor der Freigabe eines E-Commerce- oder Social-Videos:
- Jede Zeile stammt vom vorgesehenen Sprecher, und stille Figuren erzeugen keine falsche Lippensynchronität.
- Schnitte erfolgen nahe den gewünschten Zeitpunkten, mit genügend Raum für Dialoge und Produktaktionen.
- Produktfarbe, Struktur, Logo, Textur und Proportionen bleiben stabil.
- Hände, Gesichter, Reflexionen, Schatten, Kontaktpunkte und sichtbarer Text bestehen die Prüfung.
- Die Bildgestaltung passt zur vorgesehenen PDP, Marketplace-Listung, Reel, TikTok oder Anzeige.
Den Prompt in einen WeShop AI Workflow überführen
Öffnen Sie den MiniMax H3 Workflow in WeShop AI und wählen Sie den Eingabemodus, der zu Ihren Assets passt. Verwenden Sie Text, um von Grund auf zu erstellen, einen ersten Frame, um die Eröffnungskomposition festzulegen, oder den Full-Reference-Modus, wenn separate Assets Produktidentität, Bewegung oder Sound steuern.
Folgen Sie dann fünf Schritten:
- Definieren Sie Deliverable und Dauer.
- Weisen Sie Sprecher, Referenzen und festgelegte Produktdetails zu.
- Schreiben Sie eine realistische Zeitleiste nach dem MiniMax H3 Prompt-Leitfaden.
- Generieren Sie einen Entwurf und prüfen Sie Steuerungsfehler.
- Erstellen Sie Kampagnenvarianten erst, nachdem das Basisvideo die Prüfung bestanden hat.
Für Dialoganzeigen, Demos, Erklärvideos und Videos mit mehreren Charakteren ist die Erkenntnis dieses MiniMax H3 Prompt-Leitfadens einfach: Mehr Details erzeugen nicht automatisch ein schöneres Video. Die richtigen Details erzeugen ein besser steuerbares Video.
Redaktioneller Hinweis: Bestätigen Sie vor der Veröffentlichung die Erlaubnis für Aufnahmen Dritter, Charakterähnlichkeiten oder Stimmreferenzen.

