So erstellen Sie ein 15-sekündiges KI-Modevideo aus zwei Referenzbildern
Erfahren Sie, wie Sie mit Atmosphären- und Charakterreferenzbildern sowie WeShop MiniMax H3 ein 15-sekündiges cineastisches KI-Modevideo erstellen.
Dieses Tutorial zeigt Modemarken, E-Commerce-Händlern, Kreativteams und Content-Creatorn, wie sie mit zwei Referenzbildern ein cineastisches KI-Modevideo mit einem konsistenten Charakter und einer einheitlichen visuellen Ausrichtung erstellen.
Ein Bild legt Atmosphäre, Beleuchtung und Filmlook fest. Das andere definiert das Aussehen und Outfit des Models. Zusammen mit einem strukturierten Prompt bilden sie die visuelle Grundlage für einen 15-sekündigen horizontalen Modewerbespot.
- Eingabe: Eine Atmosphärenreferenz, eine Charakterreferenz und ein Videoprompt
- Tool: WeShop MiniMax H3
- Ausgabe: Ein 15-sekündiges KI-Modevideo im Format 16:9
- Grundlage des Falls: Zwei bereitgestellte Referenzbilder, der Generierungsprompt und das resultierende Video
Dieser Fall dokumentiert ein Generierungsergebnis. Abweichende Eingaben oder spätere Generierungen können andere Details liefern.
Blonde fashion model in a glossy black coat standing in front of an orange nighttime fire
|
Front, side, and back reference views of a blonde model wearing a glossy black trench coat
|
Schritt 1: Zwei Referenzbilder mit unterschiedlichen Rollen vorbereiten
Vermeiden Sie zwei Referenzbilder, die dieselben Informationen vermitteln. In diesem Workflow für KI-Modevideos sollte jedes Bild einen klar definierten Zweck erfüllen.
Bild 1 zur Steuerung von Stimmung und visuellem Stil verwenden
Die erste Referenz legt die übergeordnete Art Direction fest:
- Eine nächtliche Feuerszene mit schwarzem Rauch
- Orange-rote Flammen und kontrastreiche Beleuchtung
- Warme Reflexionen auf glänzendem schwarzem Lackleder
- Analoge Filmkörnung und subtile Bildschäden
- Grafiken im Stil einer Sendeunterbrechung oder Überwachungskamera
- Eine kühle, gefährliche, redaktionelle Komposition für eine Modeanzeige
Dieses Bild sollte vermitteln, wie sich das finale Video anfühlt, statt jedes Detail des Charakters festzulegen.
Bild 2 zur Unterstützung der Charakterkonsistenz verwenden
Die zweite Referenz zeigt den Charakter von vorne, von der Seite und von hinten. Sie liefert dem Generator für KI-Modevideos wiedererkennbare visuelle Anker:
- Langes platinblondes Haar
- Schmale schwarze Retro-Sonnenbrille
- Ein glänzender schwarzer Lackleder-Trenchcoat
- Eine taillierte Silhouette mit Gürtel und langem Mantel
- Schwarze Stiefel mit Absatz
- Eine kühle, selbstbewusste Modepose
Bevor Sie Referenzen hochladen, bestätigen Sie, dass Sie über die erforderlichen Rechte zur Nutzung der abgebildeten Person, des Kleidungsbildes und des generierten Ergebnisses verfügen. Wenn die Referenz eine reale Person zeigt, holen Sie die entsprechende Genehmigung ein und vermeiden Sie den Eindruck einer nicht bestehenden Empfehlung oder Unterstützung.
Schritt 2: Referenzbilder in WeShop MiniMax H3 hochladen
Öffnen Sie WeShop MiniMax H3 und suchen Sie den Bereich für die Videogenerierung mit Referenzbildern.
Laden Sie die Ausgangsbilder entsprechend ihrer vorgesehenen Rollen hoch:
- Verwenden Sie Bild 1 als Referenz für Atmosphäre und visuellen Stil.
- Verwenden Sie Bild 2 als Referenz für Charakter und Outfit.
- Bestätigen Sie, dass beide Bilder korrekt angezeigt werden.
- Prüfen Sie, ob Haare, Sonnenbrille, Trenchcoat-Silhouette und Feuerbeleuchtung klar sichtbar sind.
Die aktuelle Benutzeroberfläche kann bestimmte Regeln für Anzahl, Reihenfolge, Format oder Größe der Referenzbilder anwenden. Folgen Sie den Optionen, die auf der aktuellen Tool-Seite angezeigt werden.

Schritt 3: Einen strukturierten Prompt für ein KI-Modevideo eingeben
Ein hilfreicher Prompt sollte die Rolle jedes Referenzbilds definieren, bevor Ausgabe, Charakter, Umgebung und Schnittstil beschrieben werden.
Verwenden Sie für diesen Fall den folgenden Prompt:
Bild 1 ist die Referenz für die Gesamttextur, Stimmung und Atmosphäre. Bild 2 ist die Referenz für das Aussehen des Charakters.
Erstelle einen 15-sekündigen horizontalen Modefilm im Format 16:9. Halte den Charakter konsistent: langes platinblondes Haar, schmale schwarze Retro-Sonnenbrille, ein glänzender schwarzer Lackleder-Trenchcoat und ein kühler, selbstbewusster Modeausdruck. Oranges Feuerlicht reflektiert auf dem Ledermantel.
Verwende einen cineastischen Modewerbespot-Stil mit schnellen Schnitten in einer nächtlichen Feuerszene mit schwarzem Rauch und orange-roten Flammen. Integriere VHS-Störungen, CCTV-Sendeunterbrechungen, analoge Filmkörnung der 1990er-Jahre, Scanlines, chromatische Aberration, Light Leaks, Übergänge mit weißem Blitz und dezentes Kamerawackeln.
Der Prompt enthält fünf Steuerungsebenen:
| Steuerungsebene | Prompt-Inhalt | Zweck |
|---|---|---|
| Referenzrollen | Bild 1 steuert die Atmosphäre; Bild 2 steuert das Aussehen | Verringert Mehrdeutigkeiten zwischen den beiden Eingaben |
| Ausgabeformat | 15 Sekunden, 16:9, horizontal | Definiert das gewünschte Ergebnis |
| Charakteranker | Platinblondes Haar, schmale Sonnenbrille, glänzender schwarzer Mantel | Verstärkt wiedererkennbare Merkmale über verschiedene Einstellungen hinweg |
| Umgebung und Beleuchtung | Nachtfeuer, Rauch, orange-rote Flammen, Lederreflexionen | Schafft ein einheitliches Setting |
| Filmsprache | Schnelle Schnitte, VHS-Störungen, Körnung, Scanlines und Light Leaks | Legt den redaktionellen Werbestil fest |
Das Ziel ist nicht, möglichst viele Adjektive aneinanderzureihen. Jede Anweisungsgruppe sollte einen Aspekt des Ergebnisses steuern.
Halten Sie die Charakterbeschreibung kurz und wiedererkennbar. Bauen Sie die Umgebung um einen stimmigen Ort auf und wählen Sie anschließend visuelle Effekte, die denselben Werbestil unterstützen.
Schritt 4: Das 15-sekündige KI-Modevideo generieren
Überprüfen Sie die beiden Referenzbilder und den Prompt, bevor Sie die Generierung starten.
Wenn die aktuelle Benutzeroberfläche passende Steuerungen bietet, verwenden Sie Einstellungen, die dem gewünschten Ergebnis entsprechen:
- Dauer: 15 Sekunden
- Seitenverhältnis: 16:9
- Ausrichtung: Horizontal
- Weitere Einstellungen: Folgen Sie den aktuell in WeShop MiniMax H3 verfügbaren Optionen
Gehen Sie nicht davon aus, dass jedes Detail über eine separate Steuerung konfiguriert werden muss. Einige Anforderungen können stattdessen im Prompt formuliert werden. Prüfen Sie auf der aktuellen Produktseite die verfügbaren Daueroptionen, Seitenverhältnis-Steuerungen, Auflösungseinstellungen, Punkte, Preise und Generierungslimits.
Klicken Sie auf die in der Benutzeroberfläche angezeigte Generierungsschaltfläche, sobald die Eingaben bereit sind.
Sie können es direkt mit dem Tool auf der rechten Seite ausprobieren.

Schritt 5: Charakterkonsistenz und Endergebnis prüfen
Sehen Sie sich das vollständig generierte Video an, bevor Sie einzelne Frames untersuchen. Bewerten Sie Charakter, Atmosphäre und Schnittstil getrennt voneinander.
Charakterkonsistenz im KI-Modevideo prüfen
Vergleichen Sie den Charakter in Nahaufnahmen, Profilaufnahmen, Ganzkörperframes und Gehsequenzen. Konzentrieren Sie sich auf die prägnantesten Anker:
- Platinblondes Haar
- Schmale schwarze Sonnenbrille
- Glänzender schwarzer Trenchcoat
- Gesichtsstruktur und Gesamtstyling
- Kühle, selbstbewusste Ausdrücke und Posen
In diesem Fall bleiben die wichtigsten Stilmerkmale in Gesichtsnahaufnahmen, Profilansichten, Ganzkörperaufnahmen und Gehsequenzen wiedererkennbar. Gesichter, Hände, Accessoires und Kleidungsdetails in KI-generierten Videos erfordern jedoch weiterhin eine menschliche Prüfung.
Prüfen, ob die Atmosphäre zu Bild 1 passt
Achten Sie auf Kontinuität bei den folgenden Elementen:
- Nächtliches Feuer-Setting
- Schwarzer Rauch und orange-rote Flammen
- Dunkle Hintergründe mit kontrastreicher Beleuchtung
- Orangefarbene Reflexionen auf glänzendem Leder
- Eine cineastische Umgebung, die Feuer und ein Fahrzeug kombiniert
Die Atmosphärenreferenz sollte die gesamte visuelle Sprache leiten, ohne jeden Frame dazu zu zwingen, die ursprüngliche Komposition zu kopieren.
Prüfen, ob die Effekte den Rhythmus einer Modeanzeige unterstützen
Das Ergebnis umfasst Porträtnahaufnahmen, Kleidungsdetails, Ganzkörperbewegungen, Feueraufnahmen der Umgebung und Frames, die einer Sendeunterbrechung ähneln.
Prüfen Sie, ob diese Effekte im Video natürlich erscheinen:
- Schnitt mit schnellem Tempo
- Analoge Filmkörnung
- Störungen im VHS- oder CCTV-Stil
- Scanlines und chromatische Aberration
- Light Leaks und Übergänge mit weißem Blitz
- Dezentes Bildwackeln
Die Aufnahme eines Effekts in den Prompt beweist nicht, dass das generierte Video ihn präzise reproduziert hat. Bewerten Sie jeden Effekt anhand der tatsächlichen Frames.
Wenn das erste Ergebnis verbessert werden muss
Bestimmen Sie zunächst, ob das Problem den Charakter, die Umgebung oder die visuellen Effekte betrifft. Überarbeiten Sie dann nur den relevanten Teil des Prompts.
- Der Charakter verändert sich zwischen den Einstellungen: Entfernen Sie sekundäre Erscheinungsdetails und wiederholen Sie die wesentlichen Anker für Haare, Sonnenbrille und Mantel.
- Das Outfit verändert sich: Betonen Sie das glänzende schwarze Lackledermaterial, die lange Silhouette und die taillierte Form mit Gürtel.
- Das Feuer überlagert das Motiv: Geben Sie an, dass der Charakter das Hauptmotiv ist und Flammen sowie Rauch im Hintergrund bleiben.
- Die visuelle Gestaltung wirkt überladen: Reduzieren Sie die Anzahl der Glitch-Effekte und priorisieren Sie Filmkörnung, Scanlines und Light Leaks.
- Die Einstellungsfolge wirkt unfokussiert: Vereinfachen Sie die Vorgaben auf drei Prioritäten – Modewerbespot, schnelle Schnitte und Charakter-Nahaufnahmen.
Ändern Sie jeweils nur eine Variablengruppe. So lässt sich leichter bestimmen, welche Überarbeitung die Ausgabe verbessert hat.
Speichern Sie erfolglose Generierungen, wenn möglich. Ein fehlgeschlagenes Ergebnis, ein überarbeiteter Prompt und ein korrigiertes Ergebnis liefern glaubwürdigere Belege als ein erfolgreiches Video, das ohne Kontext gezeigt wird.
Abschließende Prüfung vor der Veröffentlichung
Bevor Sie das generierte Video in einer Anzeige, auf einer Produktseite oder in einem Social-Media-Beitrag verwenden, bestätigen Sie Folgendes:
- Der Charakter bleibt in den Hauptaufnahmen wiedererkennbar.
- Gesicht, Hände, Sonnenbrille und Kleidung enthalten keine offensichtlichen visuellen Fehler.
- Seitenverhältnis und Dauer erfüllen die Anforderungen der Zielplattform.
- Flammen, Fahrzeug und Hintergrundelemente enthalten keine störenden Artefakte.
- Das Audio ist für die vorgesehene Nutzung freigegeben und wird korrekt wiedergegeben.
- Sie verfügen über die erforderlichen Rechte an den Referenzbildern und der dargestellten Ähnlichkeit.
- Die Seite weist deutlich darauf hin, dass das Video KI-generiert wurde.
- Eine menschliche Prüfperson hat bestätigt, dass das Ergebnis Zuschauer nicht irreführen wird.