August 12

MiniMax H3 Prompt-Leitfaden für Dialoge und Timing

Ein praktischer MiniMax H3 Prompt-Leitfaden zur Steuerung von Dialogen, Sprecherzuordnung, Shot-Timing, Sound und Produktkontinuität – mit einem echten A/B-Videotest.

MiniMax H3 Prompt-Leitfaden: Dialoge, Schnitte und Timing steuern

Dieser MiniMax H3 Prompt-Leitfaden zeigt, wie Sie Sprecher, Lippensynchronität, Schnitte, Sound und Produktkontinuität steuern, statt sich auf eine gut aussehende, aber mehrdeutige Szenenbeschreibung zu verlassen.

Ein MiniMax H3 Community-Beispiel mit gesteuerten Dialogen, Aktionen, einem lesbaren Requisit, Kamerabewegung und einer zeitlich abgestimmten Reaktionsaufnahme.

Der Eröffnungsclip stammt aus einem strukturierten Prompt, den der Reddit-Nutzer GrayingGamer geteilt hat. Er steuert zwei Sprecher, mehrere Aktionen, ein lesbares Requisit, Kamerabewegung, Sound und eine Reaktionsaufnahme nach etwa zehn Sekunden. Kommerzielle Projekte sollten autorisierte Charaktere, Stimmen, Produkte und Marken-Assets verwenden. Die hilfreiche Erkenntnis liegt in der Logik des Drehbuchs.

Warum ein MiniMax H3 Prompt-Leitfaden wichtig ist

Ein kurzer Prompt kann für ein Subjekt und eine Aktion funktionieren. Bei mehreren Sprechern, einer Off-Screen-Stimme, mehreren Shots oder zeitlich abgestimmten Produktaktionen wird Struktur nützlich. Andernfalls kann die richtige Stimme laufen, während die falsche Figur ihre Lippen bewegt. Schnitte können zu früh erfolgen und Produkte sich zwischen den Shots verändern.

Ein praktischer MiniMax H3 Prompt-Leitfaden sollte diese Mehrdeutigkeit reduzieren. Mehr Stiladjektive können keine klare Sprecheridentität oder Zeitleiste ersetzen.

Den richtigen offiziellen MiniMax H3 Prompt-Leitfaden wählen

MiniMax bietet zwei offizielle Ressourcen:

Offizielle RessourceAm besten geeignet fürHauptstruktur
Leitfaden zum Schreiben von Video-PromptsText-zu-Video, Bild-zu-Video, Aufgaben mit erstem und letztem Frame sowie letztem Frameintegrated_multimodal_description, overall_soundscape, non_diegetic_music
Leitfaden zum Full-Reference-ModusAufgaben mit separaten Referenzen für Subjekte, Bilder, Videos, Bewegungen oder AudioSechs Abschnitte von subject_definitions bis non_diegetic_music

Leitfaden zum Schreiben von Video-Prompts

Top of the official MiniMax H3 Video Prompt Writing Guide

Leitfaden zum Full-Reference-Modus

Top of the official MiniMax H3 Full-Reference Mode Guide

Verwenden Sie den ersten MiniMax H3 Prompt-Leitfaden für text- oder framebasierte Generierung. Nutzen Sie den Full-Reference-Leitfaden, wenn ein Bild das Produkt definiert, ein Video die Bewegung steuert oder Audio die Stimmwiedergabe bestimmt.

Die aktuelle offizielle Syntax verwendet stabile IDs für Sprecher wie (S1) und (S2). Sprecheridentität und Sprechweise bleiben außerhalb von <d>. Nur Sprache und gesprochene Worte gehören hinein:

Die Moderatorin mit klarer, selbstbewusster Stimme (S1) fragt:
<d>[English] Bereit für den Drucktest?</d>

Bei einer Off-Screen-Zeile identifizieren Sie sie als Off-Screen-Voice-over und geben an, dass die Lippen der sichtbaren Figur geschlossen bleiben.

Vier Regeln für eine steuerbare Zeitleiste

  1. Sprecher und Stille zuweisen. Führen Sie jede Stimme einmal ein, behalten Sie dieselbe ID über alle Shots hinweg bei und benennen Sie, wer nicht sprechen darf.
  2. Schnitte auf der Zeitleiste platzieren. Beginnen Sie mit [Shot 1] und ohne Zeitstempel. Geben Sie späteren Shots aufsteigende Schnittzeiten:
[Shot 1] Eine Halbtotalenaufnahme etabliert Moderatorin, Techniker und Testtank.
[Shot 2] At 00:04.000, die Kamera schneidet auf eine Nahaufnahme der Uhr.
[Shot 3] At 00:08.000, die Kamera schneidet zum Techniker, der die Uhr anhebt.
  1. Sprache und Sound trennen. Platzieren Sie Dialoge in <d>, physische Geräusche in overall_soundscape und nur für das Publikum hörbare Musik in non_diegetic_music.
  2. Das Skript an die Ausgabelänge anpassen. Wenn Dialoge überlappen oder eine Produktaktion zu schnell abläuft, kürzen Sie das Skript oder verlängern Sie den Clip.

Dieser MiniMax H3 Prompt-Leitfaden steuert sowohl das Tempo als auch den Schnitt. Der Abstand zwischen Zeitstempeln ist die verfügbare Zeit für jede Aktion und Zeile.

MiniMax H3 Prompt-Test: Kurz vs. strukturiert

Wir haben ein Uhren-Drucktestkonzept mit zwei Prompt-Stilen getestet. Es erforderte drei Shots, zwei Personen, drei Zeilen, eine männliche Off-Screen-Zeile, zwei Schnitte und eine konsistente Taucheruhr. Dieser Vergleich im MiniMax H3 Prompt-Leitfaden ist eine praktische Demonstration, kein formaler Benchmark.

Die wichtigsten Prompt-Unterschiede waren:

SteuerungKurzer PromptStrukturierter Prompt
SprecherIn Absätzen nach Rolle beschriebenFestgelegt als (S1) und (S2)
Off-Screen-Zeile„Der Techniker spricht off-screen“Explizites Off-Screen-Voice-over plus Anweisung für geschlossenen Mund
SchnitteAls normale Zeitangaben geschriebenAls [Shot 2] At 00:04.000 und [Shot 3] At 00:08.000 geschrieben
SoundAllgemeine Anforderung an realistischen SoundGetrennt in overall_soundscape und non_diegetic_music

Test 1: Kurzer Prompt

Die kurze Version erzeugte ein überzeugendes Studio und hielt die Uhr erkennbar. Während der Off-Screen-Zeile des Technikers bewegte die Moderatorin jedoch sichtbar ihre Lippen, als würde sie mit seiner Stimme sprechen. Die Schnitte kamen ungefähr bei 3,54 und 6,79 Sekunden, sodass die finale Enthüllung zu früh begann.

Test 2: Strukturierter MiniMax H3 Prompt-Leitfaden

Die strukturierte Version des MiniMax H3 Prompt-Leitfadens verwendete Sprecher-IDs, ein Off-Screen-Voice-over, eine Anweisung für geschlossenen Mund und zeitlich abgestimmte Shots. Die Schnitte kamen ungefähr bei 3,92 und 7,88 Sekunden und damit nahe an den gewünschten Vier- und Acht-Sekunden-Marken.

Es zeigte sich keine offensichtliche falsche Lippensynchronität. Die Uhr füllte den Vordergrund, während die Moderatorin im Hintergrund blieb. Ihr Mund war teilweise verdeckt, daher beweist dies keine perfekte Ausführung. Dennoch vermied der strukturierte MiniMax H3 Prompt-Leitfaden die sichtbare Abweichung aus Test 1.

ErgebnisKurzer PromptStrukturierter Prompt
SprecherzuordnungMännliche Stimme bei sichtbarer Lippenbewegung der FrauKeine offensichtliche Lippensynchronität der falschen Person
Schnitt-TimingEtwa 3,54 s und 6,79 sEtwa 3,92 s und 7,88 s
ProduktkontinuitätUhr blieb erkennbarUhr blieb erkennbar mit stärkerer Nahaufnahme
Verbleibendes ProblemSichtbare SprecherabweichungGeringfügiger Pseudotext auf dem Shirt des Technikers
Kurzer Prompt bei 4,5 SekundenStrukturierter Prompt bei 4,5 Sekunden
The female host visibly lip-syncs to the male off-screen voice in the brief prompt resultThe structured prompt result avoids an obvious wrong-person lip-sync during the male off-screen line

Bei 4,5 Sekunden zeigt das kurze Ergebnis die sichtbare Moderatorin, die ihre Lippen zur Off-Screen-Stimme des Technikers bewegt. Das strukturierte Ergebnis vermeidet dieselbe offensichtliche Abweichung.

Beide Clips wirkten kommerziell plausibel. Dieser Test im MiniMax H3 Prompt-Leitfaden zeigt nicht, dass längere Prompts immer schönere Frames erzeugen. Er zeigt, dass die richtige Struktur die Steuerbarkeit verbessern kann.

Eine wiederverwendbare Vorlage für den MiniMax H3 Prompt-Leitfaden

integrated_multimodal_description:
[Shot 1] Stil, Komposition, Produkt, Sprecher (S1), Aktion und Dialog.
[Shot 2] At 00:SS.mmm, neue Bildgestaltung, Produktaktion, Sprecher (S2),
Off-Screen- oder On-Screen-Wiedergabe, exakter Dialog und wer still bleibt.
[Shot 3] At 00:SS.mmm, finale Aktion, Produktkontinuität und Endframe.

overall_soundscape: Umgebungs- und physische Geräusche in Wiedergabereihenfolge.
non_diegetic_music: Nur für das Publikum hörbare Musik oder N/A.

Befolgen Sie im Referenzmodus stattdessen den zweiten offiziellen MiniMax H3 Prompt-Leitfaden. Definieren Sie vor dem Schreiben der Zeitleiste, was jede <Subject N>, <Picture N>, <Video N> oder <Audio N> steuert.

Checkliste für kommerzielle Qualität

Prüfen Sie vor der Freigabe eines E-Commerce- oder Social-Videos:

  • Jede Zeile stammt vom vorgesehenen Sprecher, und stille Figuren erzeugen keine falsche Lippensynchronität.
  • Schnitte erfolgen nahe den gewünschten Zeitpunkten, mit genügend Raum für Dialoge und Produktaktionen.
  • Produktfarbe, Struktur, Logo, Textur und Proportionen bleiben stabil.
  • Hände, Gesichter, Reflexionen, Schatten, Kontaktpunkte und sichtbarer Text bestehen die Prüfung.
  • Die Bildgestaltung passt zur vorgesehenen PDP, Marketplace-Listung, Reel, TikTok oder Anzeige.

Den Prompt in einen WeShop AI Workflow überführen

Öffnen Sie den MiniMax H3 Workflow in WeShop AI und wählen Sie den Eingabemodus, der zu Ihren Assets passt. Verwenden Sie Text, um von Grund auf zu erstellen, einen ersten Frame, um die Eröffnungskomposition festzulegen, oder den Full-Reference-Modus, wenn separate Assets Produktidentität, Bewegung oder Sound steuern.

Folgen Sie dann fünf Schritten:

  1. Definieren Sie Deliverable und Dauer.
  2. Weisen Sie Sprecher, Referenzen und festgelegte Produktdetails zu.
  3. Schreiben Sie eine realistische Zeitleiste nach dem MiniMax H3 Prompt-Leitfaden.
  4. Generieren Sie einen Entwurf und prüfen Sie Steuerungsfehler.
  5. Erstellen Sie Kampagnenvarianten erst, nachdem das Basisvideo die Prüfung bestanden hat.

Für Dialoganzeigen, Demos, Erklärvideos und Videos mit mehreren Charakteren ist die Erkenntnis dieses MiniMax H3 Prompt-Leitfadens einfach: Mehr Details erzeugen nicht automatisch ein schöneres Video. Die richtigen Details erzeugen ein besser steuerbares Video.

Redaktioneller Hinweis: Bestätigen Sie vor der Veröffentlichung die Erlaubnis für Aufnahmen Dritter, Charakterähnlichkeiten oder Stimmreferenzen.