August 11

MiniMax H3 Prompt-Leitfaden: Formel, Storyboards, Vorlagen und häufige Fehler

Erfahren Sie, wie Sie MiniMax-H3-Prompts für multimodale Referenzen, Bild-zu-Video, Text-zu-Video, Storyboards, Dialoge, Ton und Bildschirmtext schreiben.

Ein effektiver KI-Videoprompt benötigt weder Dutzende von Adjektiven noch das Format eines professionellen Drehbuchs. Er muss drei praktische Fragen beantworten:

  1. Welche Rolle spielt jedes Referenz-Asset?
  2. Was ist die zentrale Idee des Videos?
  3. Wie sollen sich Bild und Ton im Zeitverlauf entwickeln?

Wenn Sie in MiniMax H3 mit Text-, Bild-, Video- und Audio-Referenzen arbeiten, können Sie diese Anweisungen mit einer einfachen Formel organisieren:

Vollständiger Prompt = Anweisungen zu Referenz-Assets + Kernkonzept + Visuelle Sequenz

Bei Projekten, die eine stärkere Kontinuität, Produktgenauigkeit oder komplexe Kameraführung erfordern, fügen Sie einen abschließenden Abschnitt zu Konsistenzanforderungen und Ausschlüssen hinzu.

Teil 1: Die Rolle jedes Referenz-Assets definieren

Wenn Sie Referenzdateien hochladen, erklären Sie zunächst, was jedes Asset steuern soll. Gehen Sie nicht davon aus, dass das Modell die beabsichtigte Beziehung zwischen ihnen automatisch erkennt.

Zu den gängigen Referenzrollen gehören:

  • Charakterreferenz: Definiert Gesicht, Frisur, Kleidung und Gesamterscheinung.
  • Objektreferenz: Definiert ein Produkt oder Requisit.
  • Szenenreferenz: Definiert Umgebung, räumliches Layout und Beleuchtung.
  • Erstes oder letztes Bild: Legt fest, wie das Video beginnen oder enden soll.
  • Stilreferenz: Steuert Farbe, Textur und Bildsprache.
  • Kompositionsreferenz: Steuert die Platzierung von Motiven und visuelle Beziehungen.
  • Bewegungsreferenz: Liefert Bewegungen für eine Person oder ein Objekt.
  • Kamerareferenz: Liefert ein Muster für Kamerabewegungen.
  • Stimmreferenz: Steuert die Stimme eines Charakters.
  • Audio-Wiederverwendung: Verwendet einen ganzen oder teilweisen hochgeladenen Audiotrack.
  • Videobearbeitungsreferenz: Kennzeichnet Elemente, die in einem bestehenden Video hinzugefügt, entfernt oder verändert werden sollen.

Ein Referenzblock könnte so aussehen:

@Image1 liefert das Gesicht, die Frisur und das Outfit der Heldin.
@Image2 liefert das dunkle Schloss und das Gegenlicht am frühen Morgen.
@Video1 liefert die Tanzbewegung.
@Audio1 liefert den musikalischen Rhythmus und die Gesamtstimmung.

Wenn ein Merkmal konsistent bleiben muss, formulieren Sie diese Anforderung direkt:

Halten Sie die Gesichtszüge, die silberne Frisur und das weiß bestickte Outfit des Charakters aus @Image1 konsistent.

Teil 2: Das Kernkonzept des Videos definieren

Das Kernkonzept sollte das gesamte Video in einem Satz zusammenfassen. Es sollte mindestens Folgendes enthalten:

  1. Motiv: Wer oder was erscheint.
  2. Ort: Wo die Szene stattfindet.
  3. Ereignis: Was das Motiv tut.
  4. Format und Stil: Werbung, Film, Animation, Dokumentation oder eine andere Umsetzung.
  5. Kameraregel: Eine durchgehende Einstellung, schnelle Schnitte, Luftaufnahmen oder eine andere Methode.

Zum Beispiel:

Eine junge Frau, deren Erscheinung @Image1 folgt, führt die Schwerttanzbewegung aus @Video1
im Kirschblütenhof aus @Image2 aus. Verwenden Sie einen realistischen, filmischen chinesischen Historienstil
und präsentieren Sie die Sequenz als eine durchgehende Einstellung.

Halten Sie diese Aussage prägnant. Wenn die Kernidee mehrere nicht zusammenhängende Charaktere, Orte oder Handlungsstränge enthält, können selbst detaillierte Einstellungsanweisungen Schwierigkeiten haben, das Ergebnis kohärent zu halten.

Teil 3: Die visuelle Sequenz beschreiben

Sie können die visuelle Sequenz nach Zeitbereich oder Einstellung strukturieren. Jedes Segment sollte die wichtigen Elemente erläutern:

  • Einstellungsgröße;
  • Motiv und Handlung;
  • Kamerabewegung;
  • Dialog oder Voice-over;
  • Umgebungsgeräusche, Musik und wichtige Soundeffekte;
  • erforderlicher Bildschirmtext;
  • Elemente, die nicht erscheinen sollen.

Zum Beispiel:

0–3 Sekunden: Totale. Die Frau betritt den Kirschblütenhof von links.
Der Hintergrund ist sanft unscharf. Verwenden Sie nur Schritte und sich im Wind bewegende Blätter.
Kein Dialog.

3–8 Sekunden: Schnitt auf eine halbnahe Einstellung. Sie zieht das Schwert und nimmt ihre Ausgangsposition ein,
der Bewegung in @Video1 folgend. Die Kamera fährt langsam vor, während Kirschblüten fallen.

8–12 Sekunden: Nahaufnahme. Das Schwert blitzt auf, die Bewegung verlangsamt sich, und die Klinge drückt
die fallenden Blütenblätter zu beiden Seiten.

12–15 Sekunden: Zurück zur Totalen. Sie beendet die Sequenz, senkt das Schwert
und blickt zur Kamera.
Nicht-diegetische Musik: N/A. Keine Hintergrundmusik hinzufügen.

Diese Struktur schafft eine klare Beziehung zwischen Handlung, Kamerabewegung und Ton. Außerdem lassen sich einzelne Einstellungen leichter überarbeiten.

So schreiben Sie MiniMax-H3-Prompts für drei Generierungsmodi

1. Generierung mit multimodalen Referenzen

Wenn Sie Charakter-, Bewegungs-, Szenen- und Audio-Referenzen gemeinsam hochladen, weisen Sie jeder Datei eine klare Aufgabe zu.

@Image1 ist die Charakterreferenz. Halten Sie Gesicht und Outfit der Heldin konsistent.
@Image2 ist die Hintergrundreferenz.
@Video1 ist die Bewegungsreferenz. Verwenden Sie die Schwerttanzbewegung.
@Audio1 ist die Musik- und emotionale Referenz.
Zeigen Sie die Heldin bei der Ausführung der referenzierten Bewegung in einem dunklen Schloss am frühen Morgen.
Richten Sie die Schnitte an den wichtigen Beats der Musik aus.

Vermeiden Sie es, eine Referenz hochzuladen, ohne zu erklären, wie sie verwendet werden soll. Ein Video kann gleichzeitig Bewegung, Kamerabewegung, Schnitt und Ton enthalten. Kennzeichnen Sie daher, welche Elemente für das Ergebnis wichtig sind.

20260811_1_fb52dea0-3c41-4a77-809b-152a480584ae_1255x294.png

screenshot-20260811-102227.png Clipboard_Screenshot_1785318067.png

2. Bild-zu-Video-Prompts

Bei der Verwendung eines Bildes erklären Sie, ob es das erste Bild, eine Charakterreferenz oder eine allgemeine visuelle Referenz ist. Bei zwei Bildern definieren Sie die Beziehung zwischen Start- und Endbild.

@Image1 ist das erste Bild: Eine Frau steht unter einem Kirschbaum und hält ein Schwert.
Animieren Sie sie von der Ausgangsposition bis zum Ende der Schwerttanzsequenz.
Verwenden Sie eine durchgehende Einstellung ohne Schnitte.
Halten Sie Charakter, Outfit und Hofkomposition konsistent.

Ein Workflow mit erstem und letztem Bild benötigt hauptsächlich Anweisungen für Bewegung, Beleuchtung und Ton, die die beiden Bilder verbinden. Wenn Sie zusätzliche Schnitte wünschen, fordern Sie diese ausdrücklich an. screenshot-20260811-122439.png

任务-66803765-1-4.png

3. Text-zu-Video-Prompts

Ohne Referenz-Assets sollten Sie Motiv, Umgebung, Handlung, visuellen Stil, Kamera und Ton detaillierter beschreiben.

15 Sekunden, 16:9, realistischer Naturdokumentationsstil.
In einem nebligen Feuchtgebiet bei Sonnenaufgang steht ein ausgewachsener weißer Kranich auf einem Bein im flachen Wasser
und dreht langsam den Kopf zur Kamera.
Weiches Gegenlicht fällt durch den Nebel, und kleine Wellen bewegen sich über das Wasser.
Die Kamera fährt ohne Schnitt langsam von einer extremen Totalen zu einer halbnahen Einstellung vor.
Verwenden Sie nur Wind, Wasser und entfernte Vogelrufe. Keine Hintergrundmusik hinzufügen.

Im Vergleich zu „Erzeuge einen Kranich, der im Wasser steht“ definiert diese Version Dauer, Seitenverhältnis, Motiv, Umgebung, Beleuchtung, Bewegung, Kameraführung und Ton. screenshot-20260811-124118.png

Wie sollten Sie die Einstellungen aufteilen?

Schnittpunkte verwenden, statt jede Sekunde eine neue Handlung hinzuzufügen

MiniMax-H3-Prompts können um Einstellungen und Schnittpunkte herum organisiert werden. Behalten Sie innerhalb jeder Einstellung eine primäre Handlung bei. Wiederholen Sie nach einem Schnitt bei Bedarf Motiv, Einstellungsgröße und räumliche Beziehung.

Sie müssen nicht jede Sekunde eine andere Handlung einführen. Übermäßig dichte Anweisungen können einander widersprechen und das Hauptereignis verschleiern.

Dialoglänge an die Einstellungsdauer anpassen

Eine dreisekündige Einstellung kann keine lange gesprochene Zeile natürlich enthalten. Lesen Sie den Dialog laut vor und schätzen Sie seine Dauer, bevor Sie ihn einer Einstellung zuordnen.

Für Dialoge, die über einen Schnitt hinweg laufen, beschreiben Sie einen J-Cut oder L-Cut:

  • J-Cut: Der Ton der nächsten Einstellung beginnt vor dem visuellen Schnitt.
  • L-Cut: Der Ton der vorherigen Einstellung läuft weiter, nachdem sich das Bild geändert hat.

Beispiel:

Einstellung 1: Eine Stimme außerhalb des Bildes sagt: „Wach auf, wach auf.“

Einstellung 2: Schnitt auf eine Nahaufnahme einer Frau mittleren Alters. Sie ist die Sprecherin der vorherigen Einstellung
und fährt fort: „Es ist Zeit, zur Schule zu gehen.“

Eine durchgehende Einstellung nicht mit einer Mehrfach-Einstellungsstruktur mischen

Wenn Sie eine durchgehende Einstellung anfordern, beschreiben Sie Bewegung innerhalb eines durchgehenden Raums. Fordern Sie nicht zusätzlich mehrere Einstellungen, harte Schnitte oder plötzliche Sprünge zwischen Orten an.

Wenn das Video mehrere Szenen benötigt, entfernen Sie die Anweisung für eine durchgehende Einstellung und definieren Sie jeden Schnitt klar.

So steuern Sie Ton und Bildschirmtext

Verschiedene Tonarten trennen

Behandeln Sie Ton als mehrere getrennte Ebenen:

  • Charakterdialog;
  • Voice-over;
  • Umgebungsgeräusche;
  • Soundeffekte der Handlung;
  • nicht-diegetische Musik.

Wenn Sie keine Hintergrundmusik wünschen, schreiben Sie:

Nicht-diegetische Musik: N/A.
Keine Hintergrundmusik hinzufügen.

Vermeiden Sie es, das Modell aufzufordern, Musik wiederzuverwenden und gleichzeitig keine Hintergrundmusik zu verlangen. Wenn Sie Umgebungsgeräusche erhalten, aber Musik entfernen möchten, unterscheiden Sie zwischen beiden.

Den exakten Bildschirmtext schreiben

Wenn das Video einen Titel, ein Logo, einen Slogan oder eine Schaltfläche benötigt, geben Sie den exakten Wortlaut an:

Der Titel auf dem Handybildschirm lautet: „KI-Videoerstellung.“
Der Schaltflächentext lautet: „Jetzt starten.“

Sie können auch Position, Häufigkeit und Animation steuern:

Zeigen Sie den Titel einmal in der Mitte des Bildes.
Blenden Sie ihn ein, halten Sie ihn zwei Sekunden lang und wiederholen Sie ihn nicht.

Überprüfen Sie generierten Text, Logos und Oberflächenelemente immer manuell. KI-generierte Videos können diese Details falsch schreiben, verzerren, duplizieren oder verändern.

Metaphern durch sichtbare Handlungen ersetzen

„Einsamkeit steigt wie die Flut“ drückt ein Gefühl aus, definiert jedoch keine sichtbare Szene.

Übersetzen Sie das Gefühl in Handlungen, Komposition, Beleuchtung, Raum und Ton:

Eine Person steht allein in der Mitte eines leeren Bahnsteigs.
Die Kamera fährt langsam zurück. Die Lichter eines abfahrenden Zuges verschwinden in der Ferne,
zurück bleiben nur Regen und das Echo einer Bahnhofsdurchsage.

Konkrete visuelle Anweisungen bieten in der Regel mehr Kontrolle als abstrakte emotionale Sprache.

Häufige Fehler bei MiniMax-H3-Prompts und ihre Behebung

Häufiger FehlerEmpfohlene Lösung
Alles als einen großen Absatz schreibenReferenz-Assets, Kernkonzept und Einstellungssequenz trennen
Assets hochladen, ohne ihren Zweck zu definierenJeder Datei eine Charakter-, Bewegungs-, Szenen-, Kompositions- oder Tonrolle zuweisen
Widersprüchliche Anweisungen aufnehmenKonfliktierende Kamera-, Ton- oder Stilanweisungen entfernen
Eine durchgehende Einstellung und mehrere Schnitte anfordernDie Sequenz als kontinuierliche Bewegung umschreiben oder die Regel für die durchgehende Einstellung entfernen
Ohne Referenzbild dasselbe Gesicht erwartenEin Charakterbild hochladen und die zu erhaltenden Merkmale benennen
Einen Text-zu-Video-Prompt zu kurz haltenMotiv, Umgebung, Handlung, Kamera, Beleuchtung und Ton ergänzen
Nur abstrakte Stilsprache verwendenIn sichtbare Farbe, Textur, Beleuchtung und Komposition umwandeln
Zu viel Dialog in eine kurze Einstellung packenDie Zeile kürzen oder die Einstellungsdauer erhöhen
Gleichzeitig verlangen, Musik zu erhalten und zu entfernenUmgebungsgeräusche, Effekte und nicht-diegetische Musik trennen
Mehreren Referenzen überlappende Aufgaben gebenDie primäre Rolle jedes Assets definieren

Kopierbare MiniMax-H3-Prompt-Vorlage

[ANWEISUNGEN ZU REFERENZ-ASSETS]
@Image1: Charakterreferenz. Halten Sie ________ konsistent.
@Image2: Produkt-/Szenenreferenz. Halten Sie ________ konsistent.
@Video1: Bewegungs-/Kamera-/Schnittreferenz. Verwenden Sie ________.
@Audio1: Stimm-/Musik-/Rhythmusreferenz. Verwenden Sie ________.

[KERNKONZEPT]
Dauer: ____ Sekunden. Seitenverhältnis: ____.
Motiv ________ führt ________ in ________ aus.
Verwenden Sie einen ________ visuellen Stil und eine ________ Kameraregel.

[VISUELLE SEQUENZ]
0–__ Sekunden: Einstellungsgröße ________; Bild ________; Handlung ________;
Kamerabewegung ________; Ton ________.

__–__ Sekunden: Einstellungsgröße ________; Bild ________; Handlung ________;
Kamerabewegung ________; Ton ________.

__–__ Sekunden: Einstellungsgröße ________; Bild ________; Handlung ________;
Kamerabewegung ________; Ton ________.

[TEXT UND TON]
Erforderlicher Bildschirmtext: „________.“
Charakter ________ sagt: „________.“
Umgebungsgeräusche: ________.
Nicht-diegetische Musik: ________.

[KONSISTENZANFORDERUNGEN UND AUSSCHLÜSSE]
Halten Sie ________ konsistent.
Fügen Sie ________ nicht ein.
pasted-1785391007599.png 迷你马克斯.png 纯净场景.png
【RICHTLINIEN FÜR REFERENZMATERIAL】
@Image 3: Visueller Szenenstil — Straßen / Nacht / unterirdische Räume, klaustrophobische Kompositionen, räumliche Tiefe, Filmkorn.
@Image 2: Typografie und grafisches Packaging — Schrifttextur, Grafikdesign, kinetische Typografie, starke Motion-Graphics-Wirkung.
@Image 1: Charaktererscheinung — Gesichter, Frisuren, Kleidungssilhouetten, Körperproportionen, Attitüde und Gesamtatmosphäre.

Referenzieren Sie nur die angegebenen Dimensionen. Kopieren Sie die Referenzbilder nicht direkt. Verwenden Sie keine realen Marken, Logos, Titel oder erkennbaren Texte aus den ursprünglichen Referenzbildern.

【KERNKONZEPT】
Ein 10-sekündiges horizontales 16:9-Trap-Musikvideo. Zwei coole Detektivbrüder performen direkt zur Kamera und rappen abwechselnd an mehreren engen unterirdischen Orten. Das gesamte Video bewegt sich im Takt des Trap-Beats und verwendet beatsynchrone harte Schnitte. Kontrastreiche englische Blocktypografie im Printposter-Stil knallt bei jedem Bassschlag auf den Bildschirm.

Gesamtästhetik: Untergrund-Musikvideokassette + Modemagazin-Collage + High-Fashion-Editorial-Qualität, mit einer kühlen, kontrollierten Performance eines Brüderduos.

【BESCHREIBUNG DER VISUELLEN SEQUENZ】

Einstellung 1 — Extreme Gesichtsnahaufnahme / Klaustrophobischer Durchgang

* Umgebung: Enger Korridor oder unterirdischer Eingang, aus kurzer Distanz gefilmt, mit Bezug auf @Image 3.
* Bildausschnitt: Extreme Nahaufnahme des Gesichts — Gesicht / Augen / Hals und Schultern / partielle Kragendetails.
* Charakter: Detektiv A blickt direkt in die Kamera und beginnt zu rappen, mit einem ruhigen, aber messerscharfen Ausdruck.
* Typografie: Riesiger fetter englischer Text, „TWO FLY“, schiebt sich in den oberen und unteren Bildbereich, ohne die Augen zu verdecken.
* Rhythmus: Beim 808-Bassschlag wird „TWO FLY“ sofort vertikal komprimiert und springt dann zurück. Während Hi-Hat-Rolls vibrieren die Buchstabenkanten schnell mit feiner fragmentierter Bewegung. Beim betonten Wort „fly“ einen Scanline-Versatz/Glitch auslösen.
* Harter Schnitt.

Einstellung 2 — Halbnahe Einstellung / Hintergrund aus Typografiewand

* Umgebung: Eine andere Wand oder eine plakatbedeckte Wand aus kurzer Distanz, visuell deutlich von Einstellung 1 unterschieden.
* Bildausschnitt: Deutlich in eine halbnahe Einstellung / Halbkörperkomposition zurückziehen.
* Charakter: Detektiv B rappt direkt zur Kamera. Seine Schultern und sein Kopf treffen den Hi-Hat-Rhythmus, während sich der Körper leicht nach vorn neigt.
* Typografie: Riesiger komprimierter englischer Text, „CLUES“, steht hinter dem Charakter und wird auf natürliche Weise von Haaren, Schultern und Kleidungssilhouette verdeckt.
* Rhythmus: Die Typografie streckt sich vertikal, als würde sich ein Poster aufrichten. Bei jeder Snare wird der Text plötzlich vergrößert, geschüttelt und mit Scanline-Versatz verschoben.
* Harter Schnitt.

Einstellung 3 — Handnahaufnahme / Verdeckungsübergang

* Umgebung: Kante einer Metalltür / eines Geländers / einer Garagenwand / Abschnitt einer niedrigen Decke.
* Bildausschnitt: Nahaufnahme mit Fokus auf Hände, Ringe, Manschetten und Kleidungstexturen.
* Charakter: Detektiv A stößt eine Handgeste zur Kamera, als würde er einen Hinweis weitergeben. Sein Gesicht bleibt im Hintergrund unscharf oder teilweise sichtbar.
* Typografie: Vertikales „BROTHERS“ erscheint an einer Seite im Vordergrund und wird kurz von der Hand verdeckt.
* Rhythmus: Bei der Phrase „move as one“ streckt sich die Typografie zu einem langen vertikalen Streifen, wird dann hart geschnitten und setzt sich beim Bassschlag neu zusammen.
* Harter Schnitt.

Einstellung 4 — Schulter-/Halsnahaufnahme zur Gesichtsnahaufnahme / Treppenhausecke

* Umgebung: Treppenhausecke / schattiger Türrahmen / niedriger Durchgang.
* Bildausschnitt: Beginnen Sie mit einer Nahaufnahme von Schulter, Hals, Kragen und Kleidungstextur → bei der Snare plötzlich in eine Gesichtsnahaufnahme hineinfahren.
* Charakter: Detektiv B dreht den Kopf und bewegt sich näher zur Kamera, während er weiter rappt.
* Typografie: „AS ONE“ bricht wie eine Schlagzeile eines Modemagazins hervor und skaliert beim Beat plötzlich nach oben.
* Rhythmus: Während der Vorwärtsfahrt wechselt die Typografie abrupt per hartem Schnitt in ein neues Layout. Sie darf niemals die Augen verdecken.
* Harter Schnitt.

Einstellung 5 — Halbkörper-Nahaufnahme mit Bewegungsnachhall / Garagen- oder Betonhintergrund

* Umgebung: Garagenähnlicher Raum oder Betonhintergrund.
* Bildausschnitt: Halbkörper-Nahaufnahme von Detektiv A.
* Charakter: Die primäre Ebene besitzt klare, präzise synchronisierte Lippenbewegungen. Eine sekundäre Ebene erzeugt einen dynamischen Bewegungsnachhall — Verschiebung im Fotokopierstil / Bildverzögerung — und bewahrt dabei die Gesichtsstruktur intakt und unverzerrt. Seine Handgeste streicht horizontal über die Linse.
* Typografie: Vertikales „CUT GOLD“ flackert im Hintergrund mit einer Dropped-Frame-Animation.
* Rhythmus: Bei „CUT“ wird das Bild sofort horizontal geteilt, wodurch ein harter Schnitt mit weißem Blitz ausgelöst wird. „GOLD“ komprimiert sich zu einem schweren Textblock und federt dann plötzlich zurück.
* Harter Schnitt.

Einstellung 6 — Zweipersonen-Nahaufnahme im Splitscreen / Farbblock-Segmentierung

* Umgebung: Unterirdischer Eingang / Wand / Geländer / Türrahmen, visuell deutlich von Einstellung 5 unterschieden.
* Bildausschnitt: Das Bild wird in zwei oder drei Farbblockbereiche geteilt. Schnelle harte Schnitte wechseln zwischen Nahaufnahmen der Gesichter beider Detektive und beschnittenen Halbkörperdetails.
* Charakter: Die beiden Detektive performen abwechselnd auf der linken und rechten Seite.
* Typografie: Fetter zentraler Text erscheint: „CASE COMPLETE.“
* Rhythmus: Die Komposition setzt sich bei jedem 808-Bassschlag durch harte Schnitte neu zusammen. Buchstaben werden zuerst abgeflacht und dann sofort gestreckt. Während Hi-Hat-Rolls springen Typografiefragmente schnell. Beim letzten Akzent Scan-Versatz kombiniert mit einer Vibration im Stil von zerrissenem Papier auslösen.
* Harter Schnitt.

Finale — Performance-Montage mit Nahaufnahmen an mehreren Orten

* Umgebungen: Schneller Wechsel zwischen einer Gesichtsnahaufnahme in einem engen Korridor, einer halbnahen Einstellung vor einer Wand, einer Handnahaufnahme, einer Schulter-/Halsnahaufnahme an einer Treppenhausecke, einer beschnittenen Halbkörperaufnahme in einer Garagenumgebung und einer Zweipersonen-Nahaufnahme in einem schattigen Türrahmen.
* Bildausschnitt: Keine Ganzkörperaufnahmen und keine weiten Gruppenaufnahmen. Verwenden Sie ausschließlich Nahaufnahmen, halbnahe Einstellungen, Gesichtsnahaufnahmen, Handnahaufnahmen, Schulter-/Halsnahaufnahmen und Halbköperaufnahmen.
* Charaktere: Die beiden Detektive rappen abwechselnd direkt zur Kamera. Lippenbewegung, Kieferbewegung, Atmung, Augenbrauen/Augen und Handgesten müssen präzise mit Vocals, Snares, Hi-Hat-Rolls und Bassschlägen synchronisiert sein.
* Typografie: Finaler Hero-Text, „CASE CLOSED“, knallt massiv ins Bild.
* Rhythmus: Jeder Bassschlag löst entweder einen harten Ortswechsel oder eine abrupte Änderung des Bildausschnitts aus. Jede Snare löst einen Typografie-Schlag oder Ebenenversatz aus. Beim letzten Beat frieren alle Fragmente der verschiedenen Szenen gleichzeitig ein, gefolgt von einem harten Schnitt auf Schwarz.

【ZUSÄTZLICHE GESAMTANFORDERUNGEN】

▍VISUELLER STIL — IM GESAMTEN VIDEO

* Starkes Korn, subtiler Film-Jitter, Fotokopierpapier-Textur, Halbtonpunkte, raue gedruckte Kanten, Scan-Versatz, Bewegungsnachhall durch Dropped Frames und hochgeschwindige Fehlregistrierung von Ebenen.
* Extrem schneller Schnitt. Verwenden Sie nur harte Schnitte, Jump Cuts, Beat Cuts, Verdeckungsschnitte, harte Schnitte mit weißem Blitz und typografiegetriebene harte Schnitte.
* Keine Überblendungen, keine Auflösungen und keine weichen Übergänge.

▍TYPOGRAFIE / GRAFISCHES PACKAGING — IM GESAMTEN VIDEO

* Typografie muss als integrierter Bestandteil des Bildes mit glaubwürdiger räumlicher Staffelung funktionieren.
* Text kann sich im Vordergrund, Mittelgrund oder Hintergrund relativ zu den Charakteren befinden.
* Charaktere können die Typografie verdecken und Typografie kann Teile der Charaktere überlagern, darf jedoch niemals die Augen oder wichtige Gesichtsausdrücke verdecken.
* Typografie muss auf Gesangsakzente, Snares, Hi-Hat-Rolls und 808-Bassschläge durch Erscheinen, Vibration, Streckung, Kompression, Versatz, Zerreißen und Rekonstruktion per hartem Schnitt reagieren.
* Stil: Schwere komprimierte Sans-Serif, riesige englische Blockschrift, vertikale Streckung, horizontale Kompression, vertikal angeordneter englischer Text, gebogene Schlagzeilen, kontrastreiches Schwarz / Weiß / Rot, Fotokopierpapierkorn, Halbtonpunkte, abgenutzter Druck, Scan-Versatz und Zine-Collage-Ästhetik.
* Halten Sie die Typografiemenge zurückhaltend: nur ein primäres Textelement pro Einstellung, höchstens mit einer kleinen Menge an Nummerierung. Kein dichter Kleinsttext und keine Logos.

▍RHYTHMUSREGELN — IM GESAMTEN VIDEO

* Hi-Hat-Roll → schnelle Mikrovibrationen, Dropped Frames, fragmentierte Rekonstruktion der Typografie.
* Snare → Typografie vergrößert sich plötzlich, Bild wird hart geschnitten, Schultern des Charakters treffen nach unten.
* 808-Bassschlag → niederfrequente Bildschirmkompression, kurze Bildverformung, Typografie streckt sich vertikal oder komprimiert sich horizontal.
* Gesangsschlüsselwörter → synchronisierte Lippenbewegung, Kieferbewegung, Kopfnicken und nach vorn gerichtete Handgesten.
* Charakterbewegung, Typografieanimation, Ortswechsel und Änderungen des Bildausschnitts müssen alle gemeinsam den Beat treffen.

▍ORTSWECHSEL — IM GESAMTEN VIDEO

* Schnelle harte Schnitte zwischen mehreren Umgebungen aus kurzer Distanz.
* Alle Orte sollten die Gesamtatmosphäre von @Image 3 bewahren, während jede Einstellung einen deutlich anderen Raum verwendet: enger Korridor, nahe Wand, schattiger Türrahmen, Metall-/Betonhintergrund, Kantenbeleuchtung, Plakatwand, Treppenhausecke, niedrige Decke, garagenähnlicher Raum, unterirdischer Eingang.
* Keine großen Establishing Shots oder komplexen großformatigen Szenen.
* Jeder Ortswechsel muss durch einen Bassschlag, eine Snare, einen Gesangsakzent oder einen Typografie-Schlag ausgelöst werden.

▍WECHSEL DER EINSTELLUNGSGRÖSSE — IM GESAMTEN VIDEO

* Änderungen der Einstellungsgröße müssen stark wahrnehmbar sein: extreme Gesichtsnahaufnahme → halbnahe Einstellung / Halbköper → Handnahaufnahme → Schulter-/Halsnahaufnahme → Zweipersonen-Nahaufnahme im Splitscreen → Gesichtsnahaufnahme → beschnittene Halbköperaufnahme.
* Verwenden Sie nicht dieselbe Einstellungsgröße direkt hintereinander.
* Jeder harte Schnitt sollte eine deutliche Änderung von Kameraabstand, Charakterorientierung, Hintergrundraum und Typografietiefe/-staffelung erzeugen.
* Kamerabewegungen können subtile Handkamera-Bewegungen, plötzliche Vorwärtsfahrten, kurze seitliche Bewegungen, schnelle Kompressionszooms und Nahbereichsschwenks umfassen.
* Verwandeln Sie die Sequenz nicht in weiche oder Zeitlupen-Kinematografie.

▍CHARAKTERREGELN — IM GESAMTEN VIDEO

* Charaktere: Zwei coole Detektive / Brüder.
* Bewahren Sie Gesichter, Frisuren, Kleidungssilhouetten, Proportionen, Attitüde und Gesamtatmosphäre der Charaktere in @Image 1.
* Die Haut soll realistisch und matt, sauber und hochwertig wirken, mit natürlichen Poren und subtiler Hauttextur.
* Keine glänzenden, überglätteten KI-Gesichter mit Beauty-Filter.
* Die beiden Brüder rappen abwechselnd direkt zur Kamera mit starker Performance-Energie.

▍CHARAKTERPERFORMANCE — IM GESAMTEN VIDEO

* Stimmvortrag: kühl, aggressiv, entspannt und doch einschüchternd, mit einem engen, gebrochenen, stark akzentuierten rhythmischen Flow.
* Dies ist keine statische Pose — sie performen aktiv.
* Klarer Lip-Sync: Lippen, Kiefer, Gesichtsausdrücke und Atmung müssen den Vocals folgen.
* Beatsynchrone Bewegungen: Kopfnicken, Schulterabsenken, nach vorn gerichtete Handgesten, Vorlehnen, Kopfdrehungen, Körperdrehungen, Annähern an die Kamera und direkt auf die Linse zeigende Finger.

▍WICHTIGE EINSCHRÄNKUNGEN — IM GESAMTEN VIDEO

* Keine Ganzkörperaufnahmen.
* Keine weiten Gruppenaufnahmen.
* Keine komplexen Menschenmengen- oder Ensembleszenen.
* Verwenden Sie im gesamten Video ausschließlich Nahaufnahmen, halbnahe Einstellungen, Gesichtsnahaufnahmen, Handnahaufnahmen, Schulter-/Halsnahaufnahmen und Halbköperaufnahmen.
* Zeigen Sie nur die Oberkörper, Gesichter, Gesten, Kleidungstexturen, Ausdrücke, Lippensynchronisation und Typografie/grafisches Packaging der Charaktere.
* Es ist nicht nötig, vollständige Körper oder Füße zu zeigen.
* Verwenden Sie keine realen Marken, Logos, Titel oder erkennbaren Originaltexte aus Referenzbildern.

Fazit

Einen MiniMax-H3-Prompt zu schreiben bedeutet, eine kreative Idee in ein klares Produktionsbriefing zu verwandeln.

Definieren Sie zuerst die Rolle jedes Referenz-Assets. Fassen Sie das Video anschließend in einem fokussierten Satz zusammen. Beschreiben Sie schließlich Einstellungen, Bewegung, Ton, Text und Einschränkungen in einer logischen Reihenfolge. Ein prägnanter Prompt mit einer starken Struktur lässt sich in der Regel leichter testen und überarbeiten als eine lange Liste von Adjektiven.

Sie können diese Vorlage auf der MiniMax-H3-Toolseite in WeShop AI verwenden oder im Hauptarbeitsbereich von WeShop AI beginnen. Prüfen Sie die aktuelle Oberfläche, bevor Sie Dauer, Auflösung oder Anforderungen an Referenzdateien festlegen, da sich die verfügbaren Optionen ändern können.