대화와 타이밍을 위한 MiniMax H3 프롬프트 가이드
실제 A/B 영상 테스트를 통해 대화, 화자 지정, 샷 타이밍, 사운드, 제품 일관성을 제어하는 실용적인 MiniMax H3 프롬프트 가이드입니다.
MiniMax H3 프롬프트 가이드: 대화, 컷, 타이밍 제어
이 MiniMax H3 프롬프트 가이드는 보기 좋지만 모호한 장면 설명에 의존하는 대신 화자, 립싱크, 컷, 사운드, 제품 일관성을 제어하는 방법을 보여줍니다.
연출된 대화, 동작, 읽을 수 있는 소품, 카메라 움직임, 타이밍이 지정된 리액션 샷을 보여주는 커뮤니티 MiniMax H3 예시입니다.
첫 번째 클립은 Reddit 사용자 GrayingGamer가 공유한 구조화된 프롬프트에서 제작되었습니다. 이 프롬프트는 두 명의 화자, 여러 동작, 읽을 수 있는 소품, 카메라 움직임, 사운드, 약 10초 지점의 리액션 샷을 지시합니다. 상업 프로젝트에는 사용 권한이 있는 캐릭터, 음성, 제품 및 브랜드 에셋을 사용해야 합니다. 여기서 유용한 핵심은 촬영 스크립트의 논리입니다.
MiniMax H3 프롬프트 가이드가 중요한 이유
짧은 프롬프트는 하나의 피사체와 하나의 동작에는 효과적일 수 있습니다. 여러 화자, 화면 밖 음성, 여러 샷 또는 타이밍이 지정된 제품 동작이 있을 때는 구조가 유용해집니다. 그렇지 않으면 올바른 음성이 재생되는데도 엉뚱한 캐릭터가 입술을 움직일 수 있습니다. 컷이 너무 일찍 들어오고 제품이 샷마다 달라질 수도 있습니다.
실용적인 MiniMax H3 프롬프트 가이드는 이러한 모호함을 줄여야 합니다. 스타일에 관한 형용사를 더 많이 쓰는 것만으로는 명확한 화자 정체성이나 타임라인을 대체할 수 없습니다.
적합한 공식 MiniMax H3 프롬프트 가이드 선택하기
MiniMax는 두 가지 공식 리소스를 제공합니다.
| 공식 리소스 | 적합한 용도 | 주요 구조 |
|---|---|---|
| 영상 프롬프트 작성 가이드 | 텍스트-투-비디오, 이미지-투-비디오, 첫 프레임 및 마지막 프레임, 마지막 프레임 작업 | integrated_multimodal_description, overall_soundscape, non_diegetic_music |
| 풀 레퍼런스 모드 가이드 | 분리된 피사체, 이미지, 비디오, 모션 또는 오디오 레퍼런스를 사용하는 작업 | subject_definitions부터 non_diegetic_music까지의 6개 섹션 |
영상 프롬프트 작성 가이드

풀 레퍼런스 모드 가이드

텍스트 또는 프레임 중심 생성에는 첫 번째 MiniMax H3 프롬프트 가이드를 사용하세요. 이미지가 제품을 정의하거나, 비디오가 모션을 제어하거나, 오디오가 음성 전달을 제어하는 경우에는 풀 레퍼런스 가이드를 사용하세요.
현재 공식 문법은 (S1) 및 (S2)와 같은 안정적인 화자 ID를 제공합니다. 화자 정체성과 전달 방식은 <d> 밖에 유지합니다. 안에는 언어와 발화 내용만 넣습니다:
명확하고 자신감 있는 목소리의 여성 진행자 (S1)가 묻습니다:
<d>[Korean] 압력 테스트 준비되셨나요?</d>
화면 밖 대사의 경우, 이를 화면 밖 보이스오버로 명시하고 화면에 보이는 캐릭터의 입술은 다문 상태를 유지한다고 작성하세요.
제어 가능한 타임라인을 위한 네 가지 규칙
- 화자와 침묵을 지정하세요. 각 음성을 한 번씩 소개하고, 모든 샷에서 동일한 ID를 유지하며, 말하면 안 되는 인물을 지정하세요.
- 컷을 타임라인에 배치하세요.
[Shot 1]은 타임스탬프 없이 시작합니다. 이후 샷에는 증가하는 컷 시간을 지정하세요:
[Shot 1] 미디엄 샷으로 진행자, 기술자, 테스트 탱크를 설정합니다.
[Shot 2] 00:04.000에 카메라가 시계 클로즈업으로 컷 전환합니다.
[Shot 3] 00:08.000에 카메라가 시계를 들어 올리는 기술자로 컷 전환합니다.
- 대사와 사운드를 분리하세요. 대사는
<d>에, 물리적 사운드는overall_soundscape에, 관객만 듣는 음악은non_diegetic_music에 넣습니다. - 스크립트를 출력 길이에 맞추세요. 대사가 겹치거나 제품 동작이 너무 빠르게 지나가면 스크립트를 줄이거나 클립 길이를 늘리세요.
이 MiniMax H3 프롬프트 가이드는 편집뿐 아니라 페이싱도 제어합니다. 타임스탬프 사이의 간격은 각 동작과 대사에 사용할 수 있는 시간입니다.
MiniMax H3 프롬프트 테스트: 간단한 방식 vs. 구조화된 방식
하나의 시계 압력 테스트 콘셉트를 두 가지 프롬프트 스타일로 테스트했습니다. 세 개의 샷, 두 명의 인물, 세 줄의 대사, 한 줄의 화면 밖 남성 대사, 두 번의 컷, 그리고 일관된 다이버 워치가 필요했습니다. 이 MiniMax H3 프롬프트 가이드 비교는 공식 벤치마크가 아닌 실용적 시연입니다.
주요 프롬프트 차이점은 다음과 같습니다:
| 제어 항목 | 간단한 프롬프트 | 구조화된 프롬프트 |
|---|---|---|
| 화자 | 문단에서 역할로 설명 | (S1) 및 (S2)로 고정 |
| 화면 밖 대사 | “기술자가 화면 밖에서 말한다” | 명시적인 화면 밖 보이스오버와 입을 다물라는 지시 |
| 컷 | 일반적인 시간 지시로 작성 | [Shot 2] At 00:04.000 및 [Shot 3] At 00:08.000으로 작성 |
| 사운드 | 사실적인 사운드에 대한 일반 요청 | overall_soundscape와 non_diegetic_music으로 분리 |
테스트 1: 간단한 프롬프트
간단한 버전은 설득력 있는 스튜디오를 만들었고 시계도 알아볼 수 있게 유지했습니다. 하지만 기술자의 화면 밖 대사가 나오는 동안 여성 진행자가 그의 목소리로 말하는 것처럼 눈에 띄게 입술을 움직였습니다. 컷은 약 3.54초와 6.79초에 들어와 마지막 공개 장면이 일찍 시작되었습니다.
테스트 2: 구조화된 MiniMax H3 프롬프트 가이드 형식
구조화된 MiniMax H3 프롬프트 가이드 버전은 화자 ID, 화면 밖 보이스오버, 입을 다문 상태 지시, 타이밍이 지정된 샷을 사용했습니다. 컷은 약 3.92초와 7.88초에 도착해 요청한 4초와 8초 지점에 근접했습니다.
명확한 잘못된 립싱크는 나타나지 않았습니다. 시계가 전경을 채우는 동안 진행자는 배경에 머물렀습니다. 그녀의 입은 일부 가려져 있었으므로 완벽한 실행을 증명하는 것은 아닙니다. 그럼에도 구조화된 MiniMax H3 프롬프트 가이드는 테스트 1에서 보인 명백한 불일치를 피했습니다.
| 결과 | 간단한 프롬프트 | 구조화된 프롬프트 |
|---|---|---|
| 화자 지정 | 남성 목소리와 보이는 여성의 입술 움직임 | 명확한 다른 인물 립싱크 없음 |
| 컷 타이밍 | 약 3.54초 및 6.79초 | 약 3.92초 및 7.88초 |
| 제품 일관성 | 시계를 알아볼 수 있게 유지 | 더 강한 클로즈업과 함께 시계를 알아볼 수 있게 유지 |
| 남은 문제 | 눈에 띄는 화자 불일치 | 기술자 셔츠의 미세한 의사 텍스트 |
| 4.5초 시점의 간단한 프롬프트 | 4.5초 시점의 구조화된 프롬프트 |
|---|---|
![]() | ![]() |
4.5초 시점에서 간단한 결과는 보이는 진행자가 기술자의 화면 밖 목소리에 맞춰 입술을 움직이는 모습을 보여줍니다. 구조화된 결과는 동일한 명백한 불일치를 피합니다.
두 클립 모두 상업적으로 그럴듯해 보였습니다. 이 MiniMax H3 프롬프트 가이드 테스트는 긴 프롬프트가 항상 더 아름다운 프레임을 만든다는 것을 보여주지 않습니다. 대신 올바른 구조가 제어력을 높일 수 있음을 보여줍니다.
재사용 가능한 MiniMax H3 프롬프트 가이드 템플릿
integrated_multimodal_description:
[Shot 1] 스타일, 구도, 제품, 화자 (S1), 동작, 대사.
[Shot 2] 00:SS.mmm에 새로운 프레이밍, 제품 동작, 화자 (S2),
화면 밖 또는 화면 안 전달 방식, 정확한 대사, 침묵을 유지할 인물.
[Shot 3] 00:SS.mmm에 마지막 동작, 제품 일관성, 마지막 프레임.
overall_soundscape: 재생 순서에 따른 주변음 및 물리적 사운드.
non_diegetic_music: 관객만 듣는 배경 음악 또는 N/A.
레퍼런스 모드에서는 대신 두 번째 공식 MiniMax H3 프롬프트 가이드를 따르세요. 타임라인을 작성하기 전에 각 <Subject N>, <Picture N>, <Video N>, 또는 <Audio N>가 무엇을 제어하는지 정의하세요.
상업 품질 체크리스트
이커머스 또는 소셜 영상을 승인하기 전에 다음을 확인하세요:
- 모든 대사가 의도한 화자에게서 나오며, 침묵해야 할 캐릭터가 잘못된 립싱크를 만들지 않습니다.
- 컷이 요청된 시간에 가깝게 발생하고, 대사와 제품 동작에 충분한 여유가 있습니다.
- 제품의 색상, 구조, 로고, 질감, 비율이 안정적으로 유지됩니다.
- 손, 얼굴, 반사, 그림자, 접점, 보이는 텍스트를 검토합니다.
- 프레이밍이 의도한 PDP, 마켓플레이스 상품 등록, Reel, TikTok 또는 광고에 적합합니다.
프롬프트를 WeShop AI 워크플로로 전환하기
WeShop AI에서 MiniMax H3 워크플로를 열고 에셋에 맞는 입력 모드를 선택하세요. 처음부터 만들려면 텍스트를 사용하고, 시작 구도를 고정하려면 첫 프레임을 사용하며, 개별 에셋으로 제품 정체성, 모션 또는 사운드를 제어하려면 풀 레퍼런스 모드를 사용하세요.
그런 다음 다음 다섯 단계를 따르세요:
- 결과물과 길이를 정의합니다.
- 화자, 레퍼런스, 고정할 제품 세부 사항을 지정합니다.
- 현실적인 MiniMax H3 프롬프트 가이드 타임라인을 작성합니다.
- 초안 하나를 생성하고 제어 실패 요소를 검토합니다.
- 기본 영상이 검토를 통과한 후에만 캠페인 변형본을 만듭니다.
대화형 광고, 데모, 설명 영상, 다중 캐릭터 영상에서 이 MiniMax H3 프롬프트 가이드의 교훈은 간단합니다. 더 많은 세부 정보가 자동으로 더 아름다운 영상을 만들지는 않습니다. 올바른 세부 정보가 더 제어하기 쉬운 영상을 만듭니다.
편집자 주: 제3자 영상, 캐릭터 초상 또는 음성 레퍼런스를 게시하기 전에 권한을 확인하세요.

