August 12

Guía de prompts de MiniMax H3 para diálogos y tiempos

Una guía práctica de prompts de MiniMax H3 para controlar diálogos, atribución de hablantes, tiempos de plano, sonido y continuidad de producto, con una prueba de vídeo A/B real.

Guía de prompts de MiniMax H3: controla diálogos, cortes y tiempos

Esta guía de prompts de MiniMax H3 muestra cómo controlar a los hablantes, la sincronización labial, los cortes, el sonido y la continuidad del producto, en lugar de depender de una descripción de escena atractiva pero ambigua.

Un ejemplo comunitario de MiniMax H3 que muestra diálogos dirigidos, acciones, un accesorio legible, movimiento de cámara y un plano de reacción cronometrado.

El clip inicial proviene de un prompt estructurado compartido por el usuario de Reddit GrayingGamer. Dirige a dos hablantes, varias acciones, un accesorio legible, movimiento de cámara, sonido y un plano de reacción alrededor de los diez segundos. Los proyectos comerciales deben utilizar personajes, voces, productos y recursos de marca autorizados. La lección útil es su lógica de guion de rodaje.

Por qué importa una guía de prompts de MiniMax H3

Un prompt breve puede funcionar para un sujeto y una acción. La estructura resulta útil con varios hablantes, una voz fuera de pantalla, múltiples planos o acciones de producto cronometradas. De lo contrario, puede reproducirse la voz correcta mientras el personaje equivocado mueve los labios. Los cortes pueden llegar antes y los productos pueden cambiar entre planos.

Una guía práctica de prompts de MiniMax H3 debe reducir esa ambigüedad. Más adjetivos sobre el estilo no pueden sustituir una identidad clara del hablante o una línea de tiempo.

Elige la guía oficial de prompts de MiniMax H3 adecuada

MiniMax ofrece dos recursos oficiales:

Recurso oficialIdeal paraEstructura principal
Guía de redacción de prompts de vídeoTexto a vídeo, imagen a vídeo, primer y último fotograma, y tareas de último fotogramaintegrated_multimodal_description, overall_soundscape, non_diegetic_music
Guía del modo de referencia completaTareas que utilizan referencias independientes de sujeto, imagen, vídeo, movimiento o audioSeis secciones, desde subject_definitions hasta non_diegetic_music

Guía de redacción de prompts de vídeo

Top of the official MiniMax H3 Video Prompt Writing Guide

Guía del modo de referencia completa

Top of the official MiniMax H3 Full-Reference Mode Guide

Utiliza la primera guía de prompts de MiniMax H3 para la generación basada en texto o fotogramas. Utiliza la guía de referencia completa cuando una imagen define el producto, un vídeo controla el movimiento o el audio controla la interpretación de voz.

La sintaxis oficial actual proporciona a los hablantes ID estables como (S1) y (S2). La identidad y la interpretación del hablante permanecen fuera de <d>. Solo el idioma y las palabras pronunciadas van dentro:

La presentadora con una voz clara y segura (S1) pregunta:
<d>[English] Ready for the pressure test?</d>

Para una línea fuera de pantalla, identifícala como una voz en off fuera de pantalla e indica que los labios del personaje visible permanecen cerrados.

Cuatro reglas para una línea de tiempo controlable

  1. Asigna hablantes y silencios. Presenta cada voz una vez, mantén el mismo ID en todos los planos e identifica quién no debe hablar.
  2. Coloca los cortes en la línea de tiempo. Empieza con [Shot 1] y sin marca de tiempo. Asigna a los planos posteriores tiempos de corte crecientes:
[Shot 1] Un plano medio presenta a la anfitriona, al técnico y al tanque de pruebas.
[Shot 2] At 00:04.000, la cámara corta a un primer plano del reloj.
[Shot 3] At 00:08.000, la cámara corta al técnico levantando el reloj.
  1. Separa la voz y el sonido. Coloca los diálogos en <d>, el sonido físico en overall_soundscape y la música solo para la audiencia en non_diegetic_music.
  2. Ajusta el guion a la duración de salida. Si los diálogos se solapan o una acción del producto transcurre demasiado rápido, acorta el guion o amplía el clip.

Esta guía de prompts de MiniMax H3 controla el ritmo además de la edición. El intervalo entre las marcas de tiempo es el tiempo disponible para cada acción y línea.

Prueba de prompts de MiniMax H3: breve frente a estructurado

Probamos un concepto de presión para un reloj con dos estilos de prompt. Requería tres planos, dos personas, tres líneas, una línea masculina fuera de pantalla, dos cortes y un reloj de buceo coherente. Esta comparación de la guía de prompts de MiniMax H3 es una demostración práctica, no un benchmark formal.

Las principales diferencias entre los prompts fueron:

ControlPrompt brevePrompt estructurado
HablantesDescritos por función en párrafosFijados como (S1) y (S2)
Línea fuera de pantalla“El técnico habla fuera de pantalla”Voz en off fuera de pantalla explícita más instrucción de boca cerrada
CortesEscritos como indicaciones de tiempo normalesEscritos como [Shot 2] At 00:04.000 y [Shot 3] At 00:08.000
SonidoSolicitud general de sonido realistaSeparado en overall_soundscape y non_diegetic_music

Prueba 1: Prompt breve

La versión breve creó un estudio convincente y mantuvo el reloj reconocible. Sin embargo, durante la línea del técnico fuera de pantalla, la presentadora movía visiblemente los labios como si hablara con su voz. Sus cortes llegaron aproximadamente a los 3,54 y 6,79 segundos, por lo que la revelación final comenzó antes de tiempo.

Prueba 2: Formato de guía de prompts estructurados de MiniMax H3

La versión estructurada de la guía de prompts de MiniMax H3 utilizó ID de hablantes, una voz en off fuera de pantalla, una instrucción de boca cerrada y planos cronometrados. Sus cortes llegaron aproximadamente a los 3,92 y 7,88 segundos, cerca de las marcas solicitadas de cuatro y ocho segundos.

No apareció ninguna sincronización labial falsa evidente. El reloj ocupaba el primer plano mientras la presentadora permanecía al fondo. Su boca estaba parcialmente oculta, por lo que esto no demuestra una ejecución perfecta. Aun así, la guía de prompts de MiniMax H3 estructurada evitó el desajuste visible de la Prueba 1.

ResultadoPrompt brevePrompt estructurado
Atribución del hablanteVoz masculina con movimiento visible de labios femeninosSin sincronización labial evidente de la persona equivocada
Tiempo de corteAproximadamente 3,54 s y 6,79 sAproximadamente 3,92 s y 7,88 s
Continuidad del productoEl reloj siguió siendo reconocibleEl reloj siguió siendo reconocible con un primer plano más potente
Problema restanteDesajuste visible del hablantePseudotexto menor en la camiseta del técnico
Prompt breve a los 4,5 segundosPrompt estructurado a los 4,5 segundos
The female host visibly lip-syncs to the male off-screen voice in the brief prompt resultThe structured prompt result avoids an obvious wrong-person lip-sync during the male off-screen line

A los 4,5 segundos, el resultado breve muestra a la presentadora visible moviendo los labios con la voz del técnico fuera de pantalla. El resultado estructurado evita el mismo desajuste evidente.

Ambos clips parecían comercialmente plausibles. Esta prueba de la guía de prompts de MiniMax H3 no demuestra que los prompts más largos siempre produzcan fotogramas más bonitos. Demuestra que la estructura adecuada puede mejorar el control.

Una plantilla reutilizable de guía de prompts de MiniMax H3

integrated_multimodal_description:
[Shot 1] Estilo, composición, producto, hablante (S1), acción y diálogo.
[Shot 2] At 00:SS.mmm, nuevo encuadre, acción del producto, hablante (S2),
interpretación fuera o dentro de pantalla, diálogo exacto y quién permanece en silencio.
[Shot 3] At 00:SS.mmm, acción final, continuidad del producto y fotograma final.

overall_soundscape: Sonidos ambientales y físicos en orden de reproducción.
non_diegetic_music: Música solo para la audiencia, o N/A.

Para el modo de referencia, sigue en su lugar la segunda guía oficial de prompts de MiniMax H3. Define qué controla cada <Subject N>, <Picture N>, <Video N> o <Audio N> antes de escribir la línea de tiempo.

Lista de comprobación de calidad comercial

Antes de aprobar un vídeo para ecommerce o redes sociales, comprueba lo siguiente:

  • Cada línea procede del hablante previsto y los personajes silenciosos no crean sincronización labial falsa.
  • Los cortes ocurren cerca de los tiempos solicitados, con espacio suficiente para los diálogos y las acciones del producto.
  • El color, la estructura, el logotipo, la textura y las proporciones del producto se mantienen estables.
  • Las manos, los rostros, los reflejos, las sombras, los puntos de contacto y el texto visible superan la revisión.
  • El encuadre es adecuado para la PDP, la ficha de marketplace, el Reel, TikTok o el anuncio previstos.

Convierte el prompt en un flujo de trabajo de WeShop AI

Abre el flujo de trabajo de MiniMax H3 en WeShop AI y elige el modo de entrada que se adapte a tus recursos. Utiliza texto para crear desde cero, un primer fotograma para fijar la composición inicial o el modo de referencia completa cuando recursos independientes controlen la identidad del producto, el movimiento o el sonido.

Después, sigue cinco pasos:

  1. Define el entregable y la duración.
  2. Asigna hablantes, referencias y detalles bloqueados del producto.
  3. Escribe una línea de tiempo realista de la guía de prompts de MiniMax H3.
  4. Genera un borrador y revisa los fallos de control.
  5. Crea variantes de campaña solo después de que el vídeo base supere la revisión.

Para anuncios con diálogo, demostraciones, vídeos explicativos y vídeos con varios personajes, la lección de esta guía de prompts de MiniMax H3 es sencilla: más detalles no producen automáticamente un vídeo más bonito. Los detalles adecuados producen uno más controlable.

Nota editorial: Confirma los permisos antes de publicar cualquier metraje de terceros, semejanza de personajes o referencia de voz.