SunoMV SunoMV
MiniMax H3(Hailuo 03)로 AI MV 만들기: 노래 자체를 모델에 입력해야 화면이 박자를 따라간다
트렌드

MiniMax H3(Hailuo 03)로 AI MV 만들기: 노래 자체를 모델에 입력해야 화면이 박자를 따라간다

게시일 · 작성자: SunoMV 팀

최근 2주간 샤오홍슈에서 가장 많이 보이는 말은 “MiniMax H3가 나왔다, MV 효과가 미쳤다”입니다. 2026년 7월 31일 기준, 이 화제는 크게 세 가지 숫자를 중심으로 돌고 있습니다. 네이티브 2K, 단일 클립 15초, 생성 시 오디오 자동 동반.

하지만 실제로 AI 뮤직비디오를 만들어본 사람이라면 이 세 숫자가 어젯밤 새벽 두 시까지 붙잡고 있던 그 문제와는 상관없다는 걸 알 겁니다. 화질은 이미 플랫폼에 올릴 정도는 충분하고, 실제로 발목을 잡는 건 다른 두 가지입니다. 후렴구를 부를 때 인물의 입 모양이 완전히 어긋나는 문제, 그리고 컷 전환과 드럼 비트가 따로 놀아서 마치 노래와 무관한 짧은 영상을 붙여놓은 것 같은 느낌입니다.

H3에서 실제로 이 두 문제를 해결하는 기능은 오히려 화제성이 가장 낮은 항목입니다. 이 글은 발표회 스펙표를 다시 읽어주는 대신, 딱 두 가지만 답합니다. H3가 MV 제작의 어느 단계를 해결하는지, 그리고 오늘 당장 어떻게 쓸 수 있는지.

AI로 노래 한 곡을 시네마틱한 뮤직비디오로 만든 완성 화면

1. 먼저 H3의 사실관계부터 정리한다

MiniMax는 2026년 7월 17일 WAIC 2026에서 Hailuo 03을 처음 공개했고, 외부에서는 MiniMax H3라고도 부릅니다. 여기저기 흩어진 정보를 표 하나로 정리하면 다음과 같습니다.

항목 H3의 실제 사양
해상도 네이티브 2K(2560×1440), 720p로 먼저 뽑고 업스케일하는 방식이 아님
단일 클립 길이 최대 15초(최소 5초부터 시작)
오디오 생성 시 대사, 효과음, 환경음을 동시에 산출하여 별도로 다시 입힐 필요 없음
참조 입력 텍스트, 참조 이미지, 참조 영상, 참조 오디오를 동시에 입력 가능
사용 가능 여부 출시 초기에는 소수 크리에이터 파트너 대상 비공개 테스트로 시작, 이후 하이루오와 협력 플랫폼으로 순차 개방

스펙에 대한 상세 정리는 서드파티 자료인 Hailuo H3 모델 설명MiniMax H3(Hailuo 3.0) 2K 영상 해설을 참고하세요. 여기서 파라미터를 다시 나열하지는 않겠습니다.

실전 규칙: 새로운 영상 모델을 보면 해상도부터 보지 말고, “내가 이미 가진 소재를 입력으로 받아줄 수 있는가”부터 물어보세요. 해상도는 완성본을 어디에 올릴 수 있는지를 정하고, 참조 능력은 그걸 열 번 다시 만들지 않아도 되는지를 정합니다.

2. AI MV의 진짜 난제는 화질이 아니라 화면이 음악을 못 따라가는 것

MV를 망치는 원인은 대개 화면이 못생겨서가 아니라 화면과 음악이 서로 다른 시간선을 갖고 있기 때문입니다.

구체적으로는 세 가지 형태로 나타나는데, 대부분 한 번씩은 겪어봤을 겁니다.

  • 입 모양 불일치: 화면 속 인물은 노래하고 있지만, 부르는 노래가 분명 이 곡이 아닙니다. 시청자는 3초 안에 몰입이 깨집니다.
  • 박자 어긋남: 후렴구가 터지는 그 한 박자에 화면은 아직 이전의 여백 컷에 머물러 있고, 화면이 전환될 즈음엔 드럼 비트가 이미 반 박자 지나가 있습니다.
  • 인물 바뀜: 같은 주인공인데 4초 시점과 12초 시점의 얼굴이 다릅니다. 그 순간 전체 영상의 서사가 무너집니다.

전통적인 해법은 이 문제를 후반 작업에 떠넘기는 것입니다. 먼저 화면을 뽑고, 수동으로 정렬하고, 수동으로 입 모양을 보정하고, 수동으로 박자에 맞춰 자릅니다. 문제는 노래 한 곡에 보통 수십 개의 컷이 들어간다는 점입니다. 수작업 정렬 비용이 화면 생성 자체보다 훨씬 크고, 이것이 바로 수많은 AI MV가 결국 “전환 효과가 붙은 사진 슬라이드쇼”로 퇴화하는 이유입니다.

AI 뮤직비디오에서 흔히 나타나는 화면과 리듬의 불일치 문제 예시

실전 규칙: AI MV가 전문적인지 판단할 때는 단일 프레임 화질을 보지 말고, 후렴구 8초 동안 화면이 몇 번 전환되는지, 그 컷이 박자에 정확히 맞물리는지를 보세요.

3. H3에서 가장 저평가된 기능: 노래 자체를 입력으로 쓸 수 있다

H3의 참조 입력 중에는 참조 오디오라는 항목이 있습니다. 오디오 한 구간을 그대로 모델에 넣어 이를 근거로 화면을 생성하게 할 수 있습니다. SunoMV에서는 참조 오디오를 최대 3개까지 넣을 수 있습니다.

MV를 만드는 사람 입장에서 이 기능의 의미는 명확합니다. 입히려는 그 노래 자체가 곧 입력이 될 수 있다는 것입니다.

  • 인물의 입 모양이 직접 입력한 보컬 음성을 따라 움직이며, 모델이 임의로 만든 입 모양이 아닙니다.
  • 화면의 리듬이 참조할 수 있는 시간축 기준점을 갖게 되어, 텍스트로 “박자에 맞춰 전환”이라고 적어놓고 운에 맡기지 않아도 됩니다.
  • 원곡의 보컬 질감을 그대로 살려야 하는 커버곡이나 라이브 느낌의 컷은 후반 작업에서 프레임 단위로 입 모양을 수정할 필요가 없습니다.

이 지점이 동시대 인기 영상 모델들과 비교했을 때 가장 실질적인 차이입니다. 멀티 컷 서사, 더 긴 길이, 더 빠른 생성 속도는 최근 몇 년간 여러 모델이 해오고 있지만, “노래”를 1급 입력으로 받아들이는 모델은 현재 선택 가능한 영상 모델 중에서도 여전히 소수입니다.

실전 규칙: 입 모양과 감정이 노래를 따라가길 원한다면 생성 단계에서 오디오를 함께 입력하세요. 후반 작업에서 입 모양을 수정하려 들면 비용이 몇 배로 뜁니다.

4. 참조 이미지 9장으로 얼굴 고정: 15초 동안 주인공을 동일 인물로 유지하기

H3의 또 다른 기능은 참조 이미지이며, SunoMV에서는 최대 9장까지 가능합니다. 이 숫자가 만드는 차이는 “조금 더 닮아 보이는” 수준이 아니라, 캐릭터 자체를 유지할 수 있느냐의 문제입니다.

참조 이미지 한 장으로는 각도 하나만 고정할 수 있습니다. 아홉 장이면 정면, 측면, 반신, 다양한 조명, 여러 의상을 커버할 수 있어 모델이 이 인물에 대한 다면적인 정보를 갖게 되고, 몸을 돌리거나 이동하거나 조명이 바뀌어도 갑자기 다른 얼굴로 바뀌지 않습니다. 여기에 동작과 카메라 워크의 기준을 잡아주는 참조 영상 최대 3개를 더하면, 15초짜리 컷 하나를 처음부터 끝까지 같은 인물이 연기하는 것으로 만들 수 있습니다.

캐릭터 일관성은 AI MV에서 가장 비용이 큰 부분입니다. 방법론은 AI 뮤직비디오 캐릭터 일관성 방법에서 더 자세히 다뤘습니다. H3는 이 일의 진입 장벽을 “이미지를 몇 장 더 준비하는 것”으로 낮췄습니다.

AI 뮤직비디오에서의 캐릭터 일관성 비교

5. H3를 언제 쓰고, 언제 쓰지 말아야 하는가

H3는 플래그십 등급이라 화질이 높은 만큼 비용도 높습니다. 전체 영상을 다 H3로 만드는 건 대부분의 경우 낭비입니다. “핵심 컷 전용”으로 쓰는 편이 훨씬 효율적입니다.

상황 권장 사항
후렴 클라이맥스, 인물 클로즈업, 입 모양이 필요한 구간 H3 사용, 참조 이미지 + 참조 오디오를 함께 입력
여백 컷, 전환, 분위기 조성 더 빠르고 저렴한 등급 사용, 절약한 크레딧을 핵심 컷에 배분
전체 초안 구성, 감을 잡는 단계 먼저 저비용 등급으로 한 번 돌려보고, 구조가 확정된 뒤 H3 투입
5초 미만의 짧은 컷 H3는 최소 5초부터 시작하므로 이런 컷은 다른 모델에 맡기기

한 편의 MV 안에서 여러 모델을 섞어 쓰는 것은 예외가 아니라 일반적인 방식입니다. 최근 바이트댄스 Seedance 업데이트도 마찬가지 맥락이며, Seedance 네이티브 4K가 AI 뮤직비디오에 갖는 의미에서 동일한 관점의 트레이드오프 분석을 다룬 바 있습니다.

실전 규칙: 한 편의 MV 예산은 피라미드 형태로 써야 합니다. 컷의 80%는 저렴한 등급으로 구조를 잡고, 핵심 컷 20%는 플래그십 모델로 승부를 봅니다.

6. 지금 바로 SunoMV에서 H3로 MV 만들기

공개 테스트를 기다릴 필요가 없습니다. SunoMV의 영상 모델 목록에서 Hailuo 03을 이미 선택할 수 있으며, 참조 이미지로 얼굴 고정, 참조 오디오로 입 모양 맞추기, 네이티브 2K 출력까지 바로 사용할 수 있습니다.

4단계로 진행하면 됩니다.

  1. 곡부터 확정하기: AI로 곡을 생성하거나 이미 가진 오디오를 직접 업로드하세요. 음악이 영상 전체의 시간축 뼈대가 됩니다.
  2. 주인공 소재 준비하기: 같은 인물의 다각도 이미지를 준비합니다. 정면, 측면, 다양한 조명으로 몇 장씩 마련하세요.
  3. 핵심 컷은 Hailuo 03 선택: 참조 이미지와 해당 소절의 보컬을 함께 입력하고, 나머지 컷은 더 저렴한 등급을 사용합니다.
  4. 3트랙 정렬 후 내보내기: 가사를 글자 단위 타임스탬프로 타임라인에 배치하고, 화면·자막·드럼 비트를 맞춘 뒤 내보냅니다.

가사와 화면을 글자 단위로 정확히 맞추는 방법은 글자 단위 동기화 가사 영상 제작 가이드를 참고하세요. 다른 사람의 전체 작업 흐름을 먼저 보고 싶다면 이 AI 노래를 완성형 MV로 만드는 튜토리얼을 입문용으로 참고할 수 있습니다.

타임라인에서 화면, 가사, 리듬을 맞추는 워크플로

자주 묻는 질문

Q: H3와 Hailuo 03은 같은 건가요? A: 네, 같습니다. MiniMax가 WAIC 2026에서 발표한 이 영상 모델의 공식 명칭은 Hailuo 03이며, 대외적으로는 흔히 MiniMax H3로 불립니다.

Q: 참조 오디오를 쓰려면 반드시 원곡 보컬이 있어야 하나요? A: 그렇지 않습니다. AI로 생성한 곡도 참조 오디오로 그대로 입력할 수 있습니다. 핵심은 확정된 오디오 구간이 있는지이지, 그것이 어디서 왔는지가 아닙니다.

Q: 15초로 MV 한 편을 만들기에 충분한가요? A: 단일 클립 기준으로는 충분합니다. 3분짜리 MV는 원래 수십 개의 컷으로 이어붙이는 것이며, 단일 컷 기준 15초는 이미 상당히 긴 편입니다. 대부분의 음악 컷은 3~8초에서 전환되어야 합니다.

Q: H3만으로 전체 영상을 만드는 게 이득인가요? A: 그렇지 않습니다. 플래그십 등급이라 비용이 저가 등급보다 눈에 띄게 높습니다. 후렴구와 클로즈업에만 아껴서 쓰고 나머지는 저렴한 등급을 쓰는 것이 가장 효율적인 방법입니다.

Q: 왜 제 입 모양은 여전히 맞지 않나요? A: 먼저 해당 소절의 오디오를 실제로 참조 입력으로 넣었는지 확인하세요. 텍스트 프롬프트에 “노래를 따라 불러라”라고만 적는 것은 소용이 없습니다. 모델은 오디오 자체를 받아야 합니다. 입 모양에 관한 일반적인 방법은 Hailuo 립싱크 가이드에 더 자세히 정리되어 있습니다.

7. 다음 단계

발표회의 화제는 일주일이면 식지만, “좋아하는 노래 한 곡을 그럴듯한 MV로 만드는” 일의 진입 장벽은 실제로 계속 낮아지고 있습니다. H3의 가치는 그 숫자들에 있는 게 아니라, “오디오”와 “인물”을 후반 작업의 골칫거리에서 생성 단계의 입력으로 바꿔놓았다는 데 있습니다.

지금 바로 SunoMV 오디오-투-비디오 생성기로 가서 Hailuo 03을 선택하고, 요즘 가장 꽂힌 그 노래를 넣어보세요. 후렴구 8초가 어떤 모습으로 완성되는지 확인할 수 있습니다.

— SunoMV 팀