Guide des prompts MiniMax H3 : formule, storyboards, modèles et erreurs courantes
Découvrez comment rédiger des prompts MiniMax H3 pour les références multimodales, l’image-vers-vidéo, le texte-vers-vidéo, les storyboards, les dialogues, le son et le texte à l’écran.
Un prompt vidéo d’IA efficace n’a pas besoin de dizaines d’adjectifs ni du format d’un scénario professionnel. Il doit répondre à trois questions pratiques :
- Quel rôle joue chaque ressource de référence ?
- Quelle est l’idée centrale de la vidéo ?
- Comment les images et le son doivent-ils évoluer au fil du temps ?
Lorsque vous travaillez avec des références de texte, d’images, de vidéos et d’audio dans MiniMax H3, vous pouvez organiser ces instructions à l’aide d’une formule simple :
Prompt complet = Instructions sur les ressources de référence + Concept central + Séquence visuelle
Pour les projets nécessitant une continuité renforcée, une fidélité produit ou des mouvements de caméra complexes, ajoutez une section finale consacrée aux exigences de cohérence et aux exclusions.
Partie 1 : Définir le rôle de chaque ressource de référence
Lorsque vous importez des fichiers de référence, expliquez d’abord ce que chaque ressource doit contrôler. Ne supposez pas que le modèle identifiera automatiquement la relation souhaitée entre elles.
Les rôles de référence courants incluent :
- Référence de personnage : Définit le visage, la coiffure, les vêtements et l’apparence générale.
- Référence d’objet : Définit un produit ou un accessoire.
- Référence de scène : Définit l’environnement, la disposition spatiale et l’éclairage.
- Première ou dernière image : Établit le début ou la fin de la vidéo.
- Référence de style : Guide les couleurs, les textures et le langage visuel.
- Référence de composition : Guide le placement des sujets et les relations visuelles.
- Référence de mouvement : Fournit le mouvement d’une personne ou d’un objet.
- Référence de caméra : Fournit un modèle de mouvement de caméra.
- Référence vocale : Guide la voix d’un personnage.
- Réutilisation audio : Utilise tout ou partie d’une piste audio importée.
- Référence de montage vidéo : Identifie les éléments à ajouter, supprimer ou modifier dans une vidéo existante.
Un bloc de références peut ressembler à ceci :
@Image1 fournit le visage, la coiffure et la tenue de l’héroïne.
@Image2 fournit le château sombre et le contre-jour du petit matin.
@Video1 fournit le mouvement de danse.
@Audio1 fournit le rythme musical et l’ambiance générale.
Si une caractéristique doit rester cohérente, indiquez directement cette exigence :
Conservez les traits du visage, la coiffure argentée et la tenue blanche brodée du personnage de @Image1.
Partie 2 : Définir le concept vidéo central
Le concept central doit résumer l’ensemble de la vidéo en une phrase. Incluez au minimum :
- Sujet : Qui ou quoi apparaît.
- Lieu : Où se déroule la scène.
- Événement : Ce que fait le sujet.
- Format et style : Publicité, film, animation, documentaire ou autre traitement.
- Règle de caméra : Un plan-séquence, des coupes rapides, des images aériennes ou une autre méthode.
Par exemple :
Une jeune femme dont l’apparence suit @Image1 exécute le mouvement de danse au sabre de @Video1
dans la cour aux cerisiers en fleurs de @Image2. Utilisez un style réaliste et cinématographique d’époque chinoise
et présentez la séquence en un seul plan-séquence.
Gardez cette phrase concise. Si l’idée centrale contient plusieurs personnages, lieux ou intrigues sans lien entre eux, des instructions de plans détaillées peuvent tout de même avoir du mal à maintenir un résultat cohérent.
Partie 3 : Décrire la séquence visuelle
Vous pouvez structurer la séquence visuelle par plage temporelle ou par plan. Chaque segment doit expliquer les éléments importants :
- Taille du plan ;
- Sujet et action ;
- Mouvement de caméra ;
- Dialogue ou voix off ;
- Son ambiant, musique et effets sonores clés ;
- Texte requis à l’écran ;
- Éléments qui ne doivent pas apparaître.
Par exemple :
0–3 secondes : Plan large. La femme entre dans la cour aux cerisiers en fleurs par la gauche.
L’arrière-plan est légèrement flou. Utilisez uniquement des bruits de pas et des feuilles agitées par le vent.
Aucun dialogue.
3–8 secondes : Coupez vers un plan moyen. Elle dégaine le sabre et prend sa position initiale,
en suivant le mouvement de @Video1. La caméra avance lentement tandis que les fleurs de cerisier tombent.
8–12 secondes : Gros plan. Le sabre scintille, le mouvement ralentit et la lame repousse
les pétales qui tombent de chaque côté.
12–15 secondes : Revenez à un plan large. Elle termine la séquence, abaisse le sabre
et regarde la caméra.
Musique non diégétique : N/A. N’ajoutez pas de musique de fond.
Cette structure crée une relation claire entre l’action, le mouvement de caméra et le son. Elle facilite également la révision de chaque plan.
Comment rédiger des prompts MiniMax H3 pour trois modes de génération
1. Génération avec références multimodales
Lorsque vous importez ensemble des références de personnage, de mouvement, de scène et d’audio, attribuez une responsabilité claire à chaque fichier.
@Image1 est la référence du personnage. Conservez le visage et la tenue de l’héroïne.
@Image2 est la référence d’arrière-plan
@Video1 est la référence de mouvement. Utilisez le mouvement de danse au sabre.
@Audio1 est la référence musicale et émotionnelle.
Montrez l’héroïne exécutant le mouvement référencé dans un château sombre au petit matin.
Synchronisez les coupes avec les temps forts de la musique.
Évitez d’importer une référence sans expliquer comment elle doit être utilisée. Une vidéo peut contenir simultanément du mouvement, des mouvements de caméra, du montage et du son ; identifiez donc les éléments importants pour le résultat.

|
|
2. Prompts image-vers-vidéo
Lorsque vous utilisez une image, expliquez s’il s’agit de la première image, d’une référence de personnage ou d’une référence visuelle générale. Lorsque vous utilisez deux images, définissez la relation entre les images de début et de fin.
@Image1 est la première image : une femme se tient sous un cerisier en tenant un sabre.
Animez-la depuis la position initiale jusqu’à la fin de la séquence de danse au sabre.
Utilisez un seul plan-séquence sans coupes.
Conservez la cohérence du personnage, de la tenue et de la composition de la cour.
Un flux de travail avec première et dernière image nécessite principalement des instructions sur le mouvement, l’éclairage et le son qui relient les deux images. Si vous souhaitez des coupes supplémentaires, demandez-les explicitement.

|
3. Prompts texte-vers-vidéo
Sans ressources de référence, décrivez plus en détail le sujet, le décor, l’action, le style visuel, la caméra et le son.
15 secondes, 16:9, style réaliste de documentaire animalier.
Dans une zone humide brumeuse à l’aube, une grue blanche adulte se tient sur une patte dans une eau peu profonde
et tourne lentement la tête vers la caméra.
Un doux contre-jour traverse la brume, et de petites ondulations parcourent l’eau.
La caméra avance lentement d’un très plan large vers un plan moyen, sans coupe.
Utilisez uniquement le vent, l’eau et des cris d’oiseaux lointains. N’ajoutez pas de musique de fond.
Par rapport à « générer une grue debout dans l’eau », cette version définit la durée, le format, le sujet, l’environnement, l’éclairage, le mouvement, la direction de caméra et le son.

Comment découper les plans ?
Utilisez des points de coupe au lieu d’ajouter une nouvelle action chaque seconde
Les prompts MiniMax H3 peuvent être organisés autour des plans et des points de coupe. Dans chaque plan, conservez une action principale. Après une coupe, reformulez le sujet, la taille du plan et la relation spatiale si nécessaire.
Vous n’avez pas besoin d’introduire une action différente chaque seconde. Des instructions trop denses peuvent entrer en conflit et masquer l’événement principal.
Adaptez la longueur des dialogues à la durée des plans
Un plan de trois secondes ne peut pas contenir naturellement une longue réplique. Lisez le dialogue à voix haute et estimez sa durée avant de l’attribuer à un plan.
Pour un dialogue qui traverse une coupe, décrivez une coupe en J ou une coupe en L :
- Coupe en J : L’audio du plan suivant commence avant la coupe visuelle.
- Coupe en L : L’audio du plan précédent continue après le changement d’image.
Exemple :
Plan 1 : Une voix hors champ dit : « Réveille-toi, réveille-toi. »
Plan 2 : Coupez vers un gros plan d’une femme d’âge mûr. C’est la personne qui parle dans le plan précédent
et elle continue : « Il est temps d’aller à l’école. »
Ne mélangez pas un plan-séquence et une structure multi-plans
Si vous demandez un seul plan-séquence, décrivez le mouvement dans un espace continu. Ne demandez pas également plusieurs plans, des coupes franches ou des sauts soudains entre différents lieux.
Si la vidéo nécessite plusieurs scènes, supprimez l’instruction de plan-séquence et définissez clairement chaque coupe.
Comment contrôler le son et le texte à l’écran
Séparez les différents types de son
Traitez le son comme plusieurs couches distinctes :
- Dialogue des personnages ;
- Voix off ;
- Son ambiant ;
- Effets sonores d’action ;
- Musique non diégétique.
Si vous ne souhaitez pas de musique de fond, écrivez :
Musique non diégétique : N/A.
N’ajoutez pas de musique de fond.
Évitez de demander au modèle de réutiliser de la musique tout en demandant l’absence de musique de fond. Si vous souhaitez conserver le son ambiant tout en supprimant la musique, faites bien la distinction entre les deux.
Écrivez le texte exact à l’écran
Si la vidéo nécessite un titre, un logo, un slogan ou un bouton, incluez le libellé exact :
Le titre sur l’écran du téléphone indique : « Création vidéo par IA ».
Le texte du bouton indique : « Commencer maintenant ».
Vous pouvez également contrôler la position, la fréquence et l’animation :
Affichez le titre une seule fois au centre de l’image.
Faites-le apparaître en fondu, maintenez-le pendant deux secondes et ne le répétez pas.
Vérifiez toujours manuellement les textes générés, les logos et les éléments d’interface. Les vidéos générées par IA peuvent comporter des fautes d’orthographe, des déformations, des duplications ou des modifications de ces détails.
Remplacez les métaphores par des actions visibles
« La solitude monte comme la marée » exprime une émotion, mais ne définit pas une scène visible.
Traduisez ce sentiment en actions, composition, éclairage, espace et son :
Une personne se tient seule au centre d’un quai de gare vide.
La caméra recule lentement. Les lumières d’un train qui part disparaissent au loin,
ne laissant que la pluie et l’écho d’une annonce en gare.
Des instructions visuelles concrètes offrent généralement davantage de contrôle qu’un langage émotionnel abstrait.
Erreurs courantes dans les prompts MiniMax H3 et comment les corriger
| Erreur courante | Correction recommandée |
|---|---|
| Tout écrire dans un seul long paragraphe | Séparez les ressources de référence, le concept central et la séquence de plans |
| Importer des ressources sans définir leur fonction | Attribuez à chaque fichier un rôle de personnage, mouvement, scène, composition ou son |
| Inclure des instructions contradictoires | Supprimez les exigences de caméra, de son ou de style qui se contredisent |
| Demander un seul plan-séquence et plusieurs coupes | Réécrivez la séquence comme un mouvement continu ou supprimez la règle de plan-séquence |
| Attendre le même visage sans image de référence | Importez une image du personnage et identifiez les caractéristiques à préserver |
| Rendre un prompt texte-vers-vidéo trop court | Ajoutez le sujet, le décor, l’action, la caméra, l’éclairage et le son |
| Utiliser uniquement un langage de style abstrait | Transformez-le en couleurs, textures, éclairage et composition visibles |
| Placer trop de dialogue dans un plan court | Raccourcissez la réplique ou augmentez la durée du plan |
| Demander de conserver et de supprimer la musique en même temps | Séparez le son ambiant, les effets et la musique non diégétique |
| Donner à plusieurs références des responsabilités qui se chevauchent | Définissez le rôle principal de chaque ressource |
Modèle de prompt MiniMax H3 à copier
[INSTRUCTIONS SUR LES RESSOURCES DE RÉFÉRENCE]
@Image1 : Référence de personnage. Conservez ________.
@Image2 : Référence de produit/scène. Conservez ________.
@Video1 : Référence de mouvement/caméra/montage. Utilisez ________.
@Audio1 : Référence de voix/musique/rythme. Utilisez ________.
[CONCEPT CENTRAL]
Durée : ____ secondes. Format : ____.
Le sujet ________ effectue ________ dans ________.
Utilisez un style visuel ________ et une règle de caméra ________.
[SÉQUENCE VISUELLE]
0–__ secondes : Taille du plan ________ ; visuel ________ ; action ________ ;
mouvement de caméra ________ ; son ________.
__–__ secondes : Taille du plan ________ ; visuel ________ ; action ________ ;
mouvement de caméra ________ ; son ________.
__–__ secondes : Taille du plan ________ ; visuel ________ ; action ________ ;
mouvement de caméra ________ ; son ________.
[TEXTE ET SON]
Texte requis à l’écran : « ________. »
Le personnage ________ dit : « ________. »
Son ambiant : ________.
Musique non diégétique : ________.
[EXIGENCES DE COHÉRENCE ET EXCLUSIONS]
Conservez ________.
N’incluez pas ________.
|
|
|
【DIRECTIVES POUR LES RESSOURCES DE RÉFÉRENCE】
@Image 3 : Style visuel de la scène — rues / nuit / espaces souterrains, compositions claustrophobes, profondeur environnementale, grain de pellicule.
@Image 2 : Typographie et habillage graphique — texture de police, conception graphique, typographie cinétique, fort impact de motion design.
@Image 1 : Apparence des personnages — visages, coiffures, silhouettes vestimentaires, proportions corporelles, attitude et atmosphère générale.
Référencez uniquement les dimensions spécifiées. Ne copiez pas directement les images de référence. N’incluez pas de marques, logos, titres ou textes reconnaissables du monde réel issus des images de référence originales.
【CONCEPT CENTRAL】
Un clip de trap horizontal de 10 secondes au format 16:9. Deux frères détectives stylés interprètent directement face à la caméra, en rappant à tour de rôle dans plusieurs lieux souterrains confinés. Toute la vidéo évolue au rythme du beat trap, avec des coupes franches synchronisées sur le beat. Une typographie anglaise en lettres capitales, contrastée et de style affiche imprimée, s’écrase à l’écran à chaque impact de basse.
Esthétique générale : cassette vidéo de musique underground + collage de magazine de mode + qualité éditoriale haute couture, avec une performance froide et maîtrisée du duo de frères.
【DESCRIPTION DE LA SÉQUENCE VISUELLE】
Plan 1 — Très gros plan du visage / Passage claustrophobe
* Décor : Couloir étroit ou entrée souterraine, filmé de près, en référence à @Image 3.
* Cadrage : Très gros plan du visage — visage / yeux / cou et épaules / détails partiels du col.
* Personnage : Le détective A regarde directement la caméra et commence à rapper, avec une expression calme mais tranchante comme une lame.
* Typographie : Un immense texte anglais en gras, « TWO FLY », entre dans le haut et le bas du cadre sans couvrir les yeux.
* Rythme : À l’impact de basse 808, « TWO FLY » se comprime instantanément verticalement, puis reprend sa forme. Durant les roulements de charleston, les bords des lettres vibrent rapidement avec un mouvement fin et fragmenté. Sur le mot accentué « fly », déclenchez un glitch de déplacement par lignes de balayage.
* Coupe franche.
Plan 2 — Plan rapproché poitrine / Arrière-plan de mur typographique
* Décor : Un mur différent ou un mur couvert d’affiches filmé de près, visuellement distinct du plan 1.
* Cadrage : Reculez nettement vers un plan rapproché poitrine / une composition mi-corps.
* Personnage : Le détective B rappe directement face à la caméra. Ses épaules et sa tête suivent le rythme du charleston, tandis que son corps se penche légèrement vers l’avant.
* Typographie : Un immense texte anglais condensé, « CLUES », se place derrière le personnage, naturellement occulté par les cheveux, les épaules et la silhouette des vêtements.
* Rythme : La typographie s’étire verticalement comme si une affiche se redressait. À chaque caisse claire, le texte s’agrandit brusquement, tremble et se déplace avec un effet de lignes de balayage.
* Coupe franche.
Plan 3 — Gros plan des mains / Transition par occultation
* Décor : Bord d’une porte métallique / rambarde / mur de garage / section d’un plafond bas.
* Cadrage : Gros plan centré sur les mains, les bagues, les poignets de manche et les textures vestimentaires.
* Personnage : Le détective A pousse un geste de la main vers la caméra, comme s’il transmettait un indice. Son visage reste flou ou partiellement visible à l’arrière-plan.
* Typographie : « BROTHERS » à la verticale apparaît sur un côté du premier plan et est brièvement occulté par la main.
* Rythme : Sur la phrase « move as one », la typographie s’étire en une longue bande verticale, puis se coupe brutalement et se reconstruit à l’impact de basse.
* Coupe franche.
Plan 4 — Gros plan épaule/cou vers gros plan visage / Angle d’escalier
* Décor : Angle d’escalier / embrasure sombre / passage bas.
* Cadrage : Commencez par un gros plan de l’épaule, du cou, du col et de la texture des vêtements → avancez soudainement vers un gros plan du visage sur la caisse claire.
* Personnage : Le détective B tourne la tête et se rapproche de la caméra tout en continuant à rapper.
* Typographie : « AS ONE » éclate comme un titre de magazine de mode, en changeant brusquement d’échelle sur le beat.
* Rythme : Durant l’avancée, la typographie passe brusquement par coupe franche à une nouvelle mise en page. Elle ne doit jamais couvrir les yeux.
* Coupe franche.
Plan 5 — Plan rapproché mi-corps avec écho de mouvement / Arrière-plan garage ou béton
* Décor : Espace de type garage ou arrière-plan en béton.
* Cadrage : Plan rapproché mi-corps du détective A.
* Personnage : Le calque principal présente des mouvements de lèvres nets et précisément synchronisés. Un calque secondaire crée un écho de mouvement dynamique — déplacement de type photocopieuse / décalage d’images — tout en préservant la structure du visage, sans déformation. Son geste de main balaie horizontalement l’objectif.
* Typographie : « CUT GOLD » vertical clignote à l’arrière-plan avec une animation en images sautées.
* Rythme : Sur « CUT », l’image est instantanément découpée horizontalement, déclenchant une coupe franche avec flash blanc. « GOLD » se compresse en un bloc typographique massif, puis rebondit soudainement.
* Coupe franche.
Plan 6 — Écran partagé en gros plan à deux personnes / Segmentation par aplats de couleur
* Décor : Entrée souterraine / mur / rambarde / encadrement de porte, visuellement distinct du plan 5.
* Cadrage : L’image est divisée en deux ou trois sections d’aplats de couleur. Des coupes franches rapides alternent entre des gros plans des visages des deux détectives et des détails mi-corps recadrés.
* Personnage : Les deux détectives se produisent alternativement à gauche et à droite.
* Typographie : Un texte central en gras apparaît : « CASE COMPLETE ».
* Rythme : La composition se reconstruit par coupes franches à chaque impact de basse 808. Les lettres s’aplatissent d’abord, puis s’étirent instantanément. Durant les roulements de charleston, des fragments typographiques sautent rapidement. Sur le dernier accent, déclenchez un déplacement par lignes de balayage combiné à une vibration façon papier déchiré.
* Coupe franche.
Final — Montage de performances en gros plan multi-lieux
* Décors : Alternance rapide entre un gros plan du visage dans un couloir étroit, un plan rapproché poitrine contre un mur, un gros plan des mains, un gros plan épaule/cou dans un angle d’escalier, un plan mi-corps recadré dans un environnement de garage et un gros plan à deux personnes dans une embrasure sombre.
* Cadrage : Aucun plan en pied et aucun plan large de groupe. Utilisez uniquement des gros plans, des plans rapprochés poitrine, des gros plans du visage, des gros plans des mains, des gros plans épaule/cou et des plans mi-corps.
* Personnages : Les deux détectives alternent le rap directement face à la caméra. Les mouvements des lèvres, de la mâchoire, la respiration, les sourcils/yeux et les gestes des mains doivent être précisément synchronisés avec les voix, les caisses claires, les roulements de charleston et les impacts de basse.
* Typographie : Le texte final principal, « CASE CLOSED », s’écrase massivement dans le cadre.
* Rythme : Chaque impact de basse déclenche une coupe franche de lieu ou un changement brusque de cadrage. Chaque caisse claire déclenche un impact typographique ou un déplacement de calque. Sur le dernier beat, tous les fragments des différentes scènes se figent simultanément, suivis d’une coupe franche au noir.
【EXIGENCES GÉNÉRALES SUPPLÉMENTAIRES】
▍STYLE VISUEL — TOUT AU LONG DE LA VIDÉO
* Grain prononcé, léger tremblement de pellicule, texture de papier photocopié, points de trame, bords imprimés rugueux, déplacement par lignes de balayage, échos de mouvement en images sautées et désalignement rapide des calques.
* Montage extrêmement rapide. Utilisez uniquement des coupes franches, jump cuts, coupes sur le beat, coupes par occultation, coupes franches avec flash blanc et coupes franches pilotées par la typographie.
* Aucun fondu, aucune transition enchaînée et aucune transition douce.
▍TYPOGRAPHIE / HABILLAGE GRAPHIQUE — TOUT AU LONG DE LA VIDÉO
* La typographie doit fonctionner comme une partie intégrée de l’image, avec une superposition spatiale crédible.
* Le texte peut exister au premier plan, au plan intermédiaire ou à l’arrière-plan par rapport aux personnages.
* Les personnages peuvent occulter la typographie, et la typographie peut recouvrir certaines parties des personnages, mais elle ne doit jamais couvrir les yeux ou les expressions faciales essentielles.
* La typographie doit réagir aux accents vocaux, aux caisses claires, aux roulements de charleston et aux impacts de basse 808 par son apparition, sa vibration, son étirement, sa compression, son déplacement, son déchirement et sa reconstruction par coupe franche.
* Style : Sans-serif condensée et épaisse, immenses lettres anglaises en capitales, étirement vertical, compression horizontale, texte anglais disposé verticalement, titres courbes, fort contraste noir / blanc / rouge, grain de papier photocopié, points de trame, impression usée, déplacement par lignes de balayage et esthétique de collage fanzine.
* Limitez la quantité de typographie : un seul élément textuel principal par plan, avec tout au plus une petite quantité de numérotation. Pas de texte dense en petits caractères ni de logos.
▍RÈGLES DE RYTHME — TOUT AU LONG DE LA VIDÉO
* Roulement de charleston → micro-vibrations rapides, images sautées, reconstruction typographique fragmentée.
* Caisse claire → la typographie s’agrandit soudainement, coupe franche de l’image, les épaules du personnage s’abaissent en rythme.
* Impact de basse 808 → compression d’écran en basses fréquences, brève déformation de l’image, la typographie s’étire verticalement ou se comprime horizontalement.
* Mots-clés vocaux → mouvements synchronisés des lèvres, de la mâchoire, hochements de tête et gestes de main vers l’avant.
* Les mouvements des personnages, l’animation typographique, les changements de lieu et les changements de cadrage doivent tous tomber ensemble sur le beat.
▍CHANGEMENT DE LIEUX — TOUT AU LONG DE LA VIDÉO
* Coupes franches rapides entre plusieurs environnements filmés de près.
* Tous les lieux doivent préserver l’atmosphère générale de @Image 3, tandis que chaque plan doit utiliser un espace clairement distinct : couloir étroit, mur proche, embrasure sombre, arrière-plan métallique/en béton, éclairage de bord, mur d’affiches, angle d’escalier, plafond bas, espace de type garage, entrée souterraine.
* Aucun plan d’ensemble large ni scène complexe à grande échelle.
* Chaque changement de lieu doit être déclenché par un impact de basse, une caisse claire, un accent vocal ou un impact typographique.
▍CHANGEMENT D’ÉCHELLE DES PLANS — TOUT AU LONG DE LA VIDÉO
* Les changements d’échelle de plan doivent être très perceptibles : très gros plan du visage → plan rapproché poitrine / mi-corps → gros plan des mains → gros plan épaule/cou → écran partagé en gros plan à deux personnes → gros plan du visage → plan mi-corps recadré.
* N’utilisez pas la même échelle de plan consécutivement.
* Chaque coupe franche doit créer un changement évident de distance de caméra, d’orientation du personnage, d’espace d’arrière-plan et de profondeur/superposition de la typographie.
* Les mouvements de caméra peuvent inclure un léger mouvement caméra à l’épaule, des avancées soudaines, de courts mouvements latéraux, des zooms de compression rapides et des balancements à courte distance.
* Ne transformez pas la séquence en une cinématographie douce ou au ralenti.
▍RÈGLES DES PERSONNAGES — TOUT AU LONG DE LA VIDÉO
* Personnages : Deux détectives / frères stylés.
* Préservez les visages, coiffures, silhouettes vestimentaires, proportions, attitude et atmosphère générale des personnages de @Image 1.
* La peau doit paraître réaliste et mate, nette et premium, avec des pores naturels et une texture de peau subtile.
* Aucun visage brillant, excessivement lissé par un filtre de beauté IA.
* Les deux frères rappent à tour de rôle directement face à la caméra avec une forte énergie de performance.
▍PERFORMANCE DES PERSONNAGES — TOUT AU LONG DE LA VIDÉO
* Interprétation vocale : froide, agressive, détendue mais intimidante, avec un flow rythmique serré, haché et fortement accentué.
* Il ne s’agit pas de poses statiques : ils se produisent activement.
* Synchronisation labiale claire : les lèvres, la mâchoire, les expressions faciales et la respiration doivent suivre les voix.
* Mouvements synchronisés sur le beat : hochements de tête, abaissements d’épaules, gestes de main vers l’avant, inclinaisons vers l’avant, rotations de tête, rotations du corps, rapprochements de la caméra et doigts pointés directement vers l’objectif.
▍RESTRICTIONS IMPORTANTES — TOUT AU LONG DE LA VIDÉO
* Aucun plan en pied.
* Aucun plan large de groupe.
* Aucune scène complexe de foule ou d’ensemble.
* Utilisez uniquement des gros plans, des plans rapprochés poitrine, des gros plans du visage, des gros plans des mains, des gros plans épaule/cou et des plans mi-corps dans toute la vidéo.
* Montrez uniquement le haut du corps, les visages, les gestes, les textures des vêtements, les expressions, la synchronisation labiale et la typographie/l’habillage graphique des personnages.
* Il n’est pas nécessaire de montrer les corps complets ni les pieds.
* N’incluez pas de marques, logos, titres ou textes originaux reconnaissables du monde réel issus d’images de référence.
Conclusion
Rédiger un prompt MiniMax H3 consiste à transformer une idée créative en brief de production clair.
Définissez d’abord le rôle de chaque ressource de référence. Résumez ensuite la vidéo en une phrase ciblée. Enfin, décrivez les plans, les mouvements, le son, le texte et les contraintes dans une séquence logique. Un prompt concis avec une structure solide est généralement plus facile à tester et à réviser qu’une longue liste d’adjectifs.
Vous pouvez appliquer ce modèle sur la page de l’outil MiniMax H3 dans WeShop AI, ou commencer depuis l’espace de travail principal de WeShop AI. Vérifiez l’interface actuelle avant de définir la durée, la résolution ou les exigences concernant les fichiers de référence, car les options disponibles peuvent changer.