MiniMax H3(Hailuo 03)로 AI MV 만들기: 노래 자체를 모델에 입력해야 화면이 박자를 따라간다
최근 2주간 샤오홍슈에서 가장 많이 보이는 말은 “MiniMax H3가 나왔다, MV 효과가 미쳤다”입니다. 2026년 7월 31일 기준, 이 화제는 크게 세 가지 숫자를 중심으로 돌고 있습니다. 네이티브 2K, 단일 클립 15초, 생성 시 오디오 자동 동반.
하지만 실제로 AI 뮤직비디오를 만들어본 사람이라면 이 세 숫자가 어젯밤 새벽 두 시까지 붙잡고 있던 그 문제와는 상관없다는 걸 알 겁니다. 화질은 이미 플랫폼에 올릴 정도는 충분하고, 실제로 발목을 잡는 건 다른 두 가지입니다. 후렴구를 부를 때 인물의 입 모양이 완전히 어긋나는 문제, 그리고 컷 전환과 드럼 비트가 따로 놀아서 마치 노래와 무관한 짧은 영상을 붙여놓은 것 같은 느낌입니다.
H3에서 실제로 이 두 문제를 해결하는 기능은 오히려 화제성이 가장 낮은 항목입니다. 이 글은 발표회 스펙표를 다시 읽어주는 대신, 딱 두 가지만 답합니다. H3가 MV 제작의 어느 단계를 해결하는지, 그리고 오늘 당장 어떻게 쓸 수 있는지.

1. 먼저 H3의 사실관계부터 정리한다
MiniMax는 2026년 7월 17일 WAIC 2026에서 Hailuo 03을 처음 공개했고, 외부에서는 MiniMax H3라고도 부릅니다. 여기저기 흩어진 정보를 표 하나로 정리하면 다음과 같습니다.
| 항목 | H3의 실제 사양 |
|---|---|
| 해상도 | 네이티브 2K(2560×1440), 720p로 먼저 뽑고 업스케일하는 방식이 아님 |
| 단일 클립 길이 | 최대 15초(최소 5초부터 시작) |
| 오디오 | 생성 시 대사, 효과음, 환경음을 동시에 산출하여 별도로 다시 입힐 필요 없음 |
| 참조 입력 | 텍스트, 참조 이미지, 참조 영상, 참조 오디오를 동시에 입력 가능 |
| 사용 가능 여부 | 출시 초기에는 소수 크리에이터 파트너 대상 비공개 테스트로 시작, 이후 하이루오와 협력 플랫폼으로 순차 개방 |
스펙에 대한 상세 정리는 서드파티 자료인 Hailuo H3 모델 설명과 MiniMax H3(Hailuo 3.0) 2K 영상 해설을 참고하세요. 여기서 파라미터를 다시 나열하지는 않겠습니다.
실전 규칙: 새로운 영상 모델을 보면 해상도부터 보지 말고, “내가 이미 가진 소재를 입력으로 받아줄 수 있는가”부터 물어보세요. 해상도는 완성본을 어디에 올릴 수 있는지를 정하고, 참조 능력은 그걸 열 번 다시 만들지 않아도 되는지를 정합니다.
2. AI MV의 진짜 난제는 화질이 아니라 화면이 음악을 못 따라가는 것
MV를 망치는 원인은 대개 화면이 못생겨서가 아니라 화면과 음악이 서로 다른 시간선을 갖고 있기 때문입니다.
구체적으로는 세 가지 형태로 나타나는데, 대부분 한 번씩은 겪어봤을 겁니다.
- 입 모양 불일치: 화면 속 인물은 노래하고 있지만, 부르는 노래가 분명 이 곡이 아닙니다. 시청자는 3초 안에 몰입이 깨집니다.
- 박자 어긋남: 후렴구가 터지는 그 한 박자에 화면은 아직 이전의 여백 컷에 머물러 있고, 화면이 전환될 즈음엔 드럼 비트가 이미 반 박자 지나가 있습니다.
- 인물 바뀜: 같은 주인공인데 4초 시점과 12초 시점의 얼굴이 다릅니다. 그 순간 전체 영상의 서사가 무너집니다.
전통적인 해법은 이 문제를 후반 작업에 떠넘기는 것입니다. 먼저 화면을 뽑고, 수동으로 정렬하고, 수동으로 입 모양을 보정하고, 수동으로 박자에 맞춰 자릅니다. 문제는 노래 한 곡에 보통 수십 개의 컷이 들어간다는 점입니다. 수작업 정렬 비용이 화면 생성 자체보다 훨씬 크고, 이것이 바로 수많은 AI MV가 결국 “전환 효과가 붙은 사진 슬라이드쇼”로 퇴화하는 이유입니다.

실전 규칙: AI MV가 전문적인지 판단할 때는 단일 프레임 화질을 보지 말고, 후렴구 8초 동안 화면이 몇 번 전환되는지, 그 컷이 박자에 정확히 맞물리는지를 보세요.
3. H3에서 가장 저평가된 기능: 노래 자체를 입력으로 쓸 수 있다
H3의 참조 입력 중에는 참조 오디오라는 항목이 있습니다. 오디오 한 구간을 그대로 모델에 넣어 이를 근거로 화면을 생성하게 할 수 있습니다. SunoMV에서는 참조 오디오를 최대 3개까지 넣을 수 있습니다.
MV를 만드는 사람 입장에서 이 기능의 의미는 명확합니다. 입히려는 그 노래 자체가 곧 입력이 될 수 있다는 것입니다.
- 인물의 입 모양이 직접 입력한 보컬 음성을 따라 움직이며, 모델이 임의로 만든 입 모양이 아닙니다.
- 화면의 리듬이 참조할 수 있는 시간축 기준점을 갖게 되어, 텍스트로 “박자에 맞춰 전환”이라고 적어놓고 운에 맡기지 않아도 됩니다.
- 원곡의 보컬 질감을 그대로 살려야 하는 커버곡이나 라이브 느낌의 컷은 후반 작업에서 프레임 단위로 입 모양을 수정할 필요가 없습니다.
이 지점이 동시대 인기 영상 모델들과 비교했을 때 가장 실질적인 차이입니다. 멀티 컷 서사, 더 긴 길이, 더 빠른 생성 속도는 최근 몇 년간 여러 모델이 해오고 있지만, “노래”를 1급 입력으로 받아들이는 모델은 현재 선택 가능한 영상 모델 중에서도 여전히 소수입니다.
실전 규칙: 입 모양과 감정이 노래를 따라가길 원한다면 생성 단계에서 오디오를 함께 입력하세요. 후반 작업에서 입 모양을 수정하려 들면 비용이 몇 배로 뜁니다.
4. 참조 이미지 9장으로 얼굴 고정: 15초 동안 주인공을 동일 인물로 유지하기
H3의 또 다른 기능은 참조 이미지이며, SunoMV에서는 최대 9장까지 가능합니다. 이 숫자가 만드는 차이는 “조금 더 닮아 보이는” 수준이 아니라, 캐릭터 자체를 유지할 수 있느냐의 문제입니다.
참조 이미지 한 장으로는 각도 하나만 고정할 수 있습니다. 아홉 장이면 정면, 측면, 반신, 다양한 조명, 여러 의상을 커버할 수 있어 모델이 이 인물에 대한 다면적인 정보를 갖게 되고, 몸을 돌리거나 이동하거나 조명이 바뀌어도 갑자기 다른 얼굴로 바뀌지 않습니다. 여기에 동작과 카메라 워크의 기준을 잡아주는 참조 영상 최대 3개를 더하면, 15초짜리 컷 하나를 처음부터 끝까지 같은 인물이 연기하는 것으로 만들 수 있습니다.
캐릭터 일관성은 AI MV에서 가장 비용이 큰 부분입니다. 방법론은 AI 뮤직비디오 캐릭터 일관성 방법에서 더 자세히 다뤘습니다. H3는 이 일의 진입 장벽을 “이미지를 몇 장 더 준비하는 것”으로 낮췄습니다.

5. H3를 언제 쓰고, 언제 쓰지 말아야 하는가
H3는 플래그십 등급이라 화질이 높은 만큼 비용도 높습니다. 전체 영상을 다 H3로 만드는 건 대부분의 경우 낭비입니다. “핵심 컷 전용”으로 쓰는 편이 훨씬 효율적입니다.
| 상황 | 권장 사항 |
|---|---|
| 후렴 클라이맥스, 인물 클로즈업, 입 모양이 필요한 구간 | H3 사용, 참조 이미지 + 참조 오디오를 함께 입력 |
| 여백 컷, 전환, 분위기 조성 | 더 빠르고 저렴한 등급 사용, 절약한 크레딧을 핵심 컷에 배분 |
| 전체 초안 구성, 감을 잡는 단계 | 먼저 저비용 등급으로 한 번 돌려보고, 구조가 확정된 뒤 H3 투입 |
| 5초 미만의 짧은 컷 | H3는 최소 5초부터 시작하므로 이런 컷은 다른 모델에 맡기기 |
한 편의 MV 안에서 여러 모델을 섞어 쓰는 것은 예외가 아니라 일반적인 방식입니다. 최근 바이트댄스 Seedance 업데이트도 마찬가지 맥락이며, Seedance 네이티브 4K가 AI 뮤직비디오에 갖는 의미에서 동일한 관점의 트레이드오프 분석을 다룬 바 있습니다.
실전 규칙: 한 편의 MV 예산은 피라미드 형태로 써야 합니다. 컷의 80%는 저렴한 등급으로 구조를 잡고, 핵심 컷 20%는 플래그십 모델로 승부를 봅니다.
6. 지금 바로 SunoMV에서 H3로 MV 만들기
공개 테스트를 기다릴 필요가 없습니다. SunoMV의 영상 모델 목록에서 Hailuo 03을 이미 선택할 수 있으며, 참조 이미지로 얼굴 고정, 참조 오디오로 입 모양 맞추기, 네이티브 2K 출력까지 바로 사용할 수 있습니다.
4단계로 진행하면 됩니다.
- 곡부터 확정하기: AI로 곡을 생성하거나 이미 가진 오디오를 직접 업로드하세요. 음악이 영상 전체의 시간축 뼈대가 됩니다.
- 주인공 소재 준비하기: 같은 인물의 다각도 이미지를 준비합니다. 정면, 측면, 다양한 조명으로 몇 장씩 마련하세요.
- 핵심 컷은 Hailuo 03 선택: 참조 이미지와 해당 소절의 보컬을 함께 입력하고, 나머지 컷은 더 저렴한 등급을 사용합니다.
- 3트랙 정렬 후 내보내기: 가사를 글자 단위 타임스탬프로 타임라인에 배치하고, 화면·자막·드럼 비트를 맞춘 뒤 내보냅니다.
가사와 화면을 글자 단위로 정확히 맞추는 방법은 글자 단위 동기화 가사 영상 제작 가이드를 참고하세요. 다른 사람의 전체 작업 흐름을 먼저 보고 싶다면 이 AI 노래를 완성형 MV로 만드는 튜토리얼을 입문용으로 참고할 수 있습니다.

자주 묻는 질문
Q: H3와 Hailuo 03은 같은 건가요? A: 네, 같습니다. MiniMax가 WAIC 2026에서 발표한 이 영상 모델의 공식 명칭은 Hailuo 03이며, 대외적으로는 흔히 MiniMax H3로 불립니다.
Q: 참조 오디오를 쓰려면 반드시 원곡 보컬이 있어야 하나요? A: 그렇지 않습니다. AI로 생성한 곡도 참조 오디오로 그대로 입력할 수 있습니다. 핵심은 확정된 오디오 구간이 있는지이지, 그것이 어디서 왔는지가 아닙니다.
Q: 15초로 MV 한 편을 만들기에 충분한가요? A: 단일 클립 기준으로는 충분합니다. 3분짜리 MV는 원래 수십 개의 컷으로 이어붙이는 것이며, 단일 컷 기준 15초는 이미 상당히 긴 편입니다. 대부분의 음악 컷은 3~8초에서 전환되어야 합니다.
Q: H3만으로 전체 영상을 만드는 게 이득인가요? A: 그렇지 않습니다. 플래그십 등급이라 비용이 저가 등급보다 눈에 띄게 높습니다. 후렴구와 클로즈업에만 아껴서 쓰고 나머지는 저렴한 등급을 쓰는 것이 가장 효율적인 방법입니다.
Q: 왜 제 입 모양은 여전히 맞지 않나요? A: 먼저 해당 소절의 오디오를 실제로 참조 입력으로 넣었는지 확인하세요. 텍스트 프롬프트에 “노래를 따라 불러라”라고만 적는 것은 소용이 없습니다. 모델은 오디오 자체를 받아야 합니다. 입 모양에 관한 일반적인 방법은 Hailuo 립싱크 가이드에 더 자세히 정리되어 있습니다.
7. 다음 단계
발표회의 화제는 일주일이면 식지만, “좋아하는 노래 한 곡을 그럴듯한 MV로 만드는” 일의 진입 장벽은 실제로 계속 낮아지고 있습니다. H3의 가치는 그 숫자들에 있는 게 아니라, “오디오”와 “인물”을 후반 작업의 골칫거리에서 생성 단계의 입력으로 바꿔놓았다는 데 있습니다.
지금 바로 SunoMV 오디오-투-비디오 생성기로 가서 Hailuo 03을 선택하고, 요즘 가장 꽂힌 그 노래를 넣어보세요. 후렴구 8초가 어떤 모습으로 완성되는지 확인할 수 있습니다.
— SunoMV 팀