MiniMax H3(Hailuo 03)做 AI MV:把歌本身餵給模型,畫面才跟得上拍子
這兩週小紅書上刷到最多的一句話是「MiniMax H3 來了,MV 效果頂飛了」。截至 2026 年 7 月 31 日,這波熱度基本圍著三個數字轉:原生 2K、單段 15 秒、生成時自帶音訊。
但如果你真做過 AI 音樂影片,會知道這三個數字並不是你昨晚熬到兩點還沒搞定的那件事。畫質早就夠發平台了,卡住你的通常是另外兩件:唱到副歌那句,人物嘴型完全不對;以及鏡頭切換和鼓點各走各的,像是給一首歌配了一段無關的短片。
H3 裡真正能解決這兩件事的能力,恰好是熱度最低的那一項。這篇不複讀發布會規格表,只回答:它到底解決了 MV 製作的哪一環,以及今天怎麼用上。

一、先把 H3 的事實擺清楚
MiniMax 在 2026 年 7 月 17 日的 WAIC 2026 上首次公開 Hailuo 03,對外也被叫作 MiniMax H3。把散落在各處的說法歸成一張表:
| 能力 | H3 的實際情況 |
|---|---|
| 解析度 | 原生 2K(2560×1440),不是先出 720p 再放大 |
| 單段時長 | 最長 15 秒(起步 5 秒) |
| 音訊 | 生成時同步產出對白、音效與環境聲,不用再單獨配一遍 |
| 參考輸入 | 文字、參考圖、參考影片、參考音訊可以同時餵進去 |
| 可用性 | 首發時僅少量創作夥伴內測,隨後逐步在海螺與合作平台放開 |
關於規格的完整整理,可以看第三方的 Hailuo H3 模型說明 和 MiniMax H3(Hailuo 3.0)2K 影片解析。這裡不再抄一遍參數。
實用規則: 看到新影片模型,先別看解析度——先問「它能不能把我已有的素材當輸入」。解析度決定成片能發到哪,參考能力決定你要不要重做十遍。
二、AI MV 的真痛點不是畫質,是畫面跟不上音樂
把一支 MV 做廢,通常不是因為畫面醜,而是因為畫面和音樂是兩條獨立的時間線。
具體表現有三種,你大概率都遇過:
- 嘴型對不上:鏡頭裡的人在唱,但唱的顯然不是這首歌。觀眾三秒內就出戲。
- 拍點錯位:副歌炸開的那一拍,畫面還停在上一個空鏡;等畫面切了,鼓點已經過去半秒。
- 換人:同一個主角,第 4 秒和第 12 秒長得不一樣,整支片子的敘事就散了。
傳統解法是把這些交給後期:先出畫面,再手動對齊、手動補口型、手動裁到拍點。問題是一首歌通常有幾十個鏡頭,手工對齊的成本遠高於生成畫面本身——這也是為什麼大量 AI MV 最後都退化成了「加了轉場的圖片幻燈片」。

實用規則: 判斷一支 AI MV 專不專業,不看單幀畫質,看副歌那 8 秒裡畫面切了幾刀、每一刀是不是壓在拍子上。
三、H3 最被低估的一項:歌本身可以當輸入
H3 的參考輸入裡有一項叫參考音訊——你可以把一段音訊直接餵給模型,讓它據此生成畫面。在 SunoMV 裡,這一項的上限是最多 3 段參考音訊。
對做 MV 的人來說,這一項的含義很直接:你要配的那首歌,本身就可以成為輸入。
- 人物的嘴型可以按你給的這段人聲來動,而不是模型自己編一段口型;
- 畫面的節奏有了一個可參照的時間錨,而不是純靠文字描述裡那句「隨節奏切換」去碰運氣;
- 需要保留原聲表演質感的翻唱、live 感鏡頭,不用再把口型交給後期一幀幀修。
這也是它和同期幾款熱門影片模型最實際的分界線。多鏡頭敘事、更長時長、更快出片,這幾年都有人在做;但能把「歌」當成一等輸入的,在能選到的影片模型裡仍是少數。
實用規則: 想要嘴型和情緒跟著歌走,就在生成階段把音訊餵進去;等到後期再修口型,成本會翻好幾倍。
四、9 張參考圖鎖臉:讓主角在 15 秒裡保持是同一個人
H3 的另一項是參考圖,SunoMV 裡的上限是最多 9 張。這個數量級帶來的差別不是「更像一點」,而是能不能撐住一個角色。
一張參考圖只能鎖一個角度。九張可以覆蓋正面、側臉、半身、不同光線和幾套服裝——模型手裡有了這個人的多面資訊,轉身、走位、光線變化時才不會突然換臉。再疊上最多 3 段參考影片給動作和運鏡打樣,一個 15 秒的鏡頭就有機會做到從頭到尾是同一個人在演。
角色一致性是 AI MV 裡最貴的一環,方法論我們在 AI 音樂影片角色一致性方法 裡拆得更細。H3 把這件事的門檻降到了「多準備幾張圖」。

五、什麼時候該用 H3,什麼時候別用
H3 是旗艦檔,畫質高、扣費也高,全片都用它多數時候是浪費。把它當成「關鍵鏡頭專用」更划算:
| 場景 | 建議 |
|---|---|
| 副歌高潮、人物特寫、有口型的段落 | 用 H3,參考圖 + 參考音訊一起給 |
| 空鏡、轉場、氛圍鋪墊 | 用更快更省的檔位,省下的額度留給關鍵鏡頭 |
| 全片試排、找感覺的草稿階段 | 先用低成本檔位跑一遍,結構定了再上 H3 |
| 需要短於 5 秒的碎切 | H3 起步就是 5 秒,這類鏡頭交給別的模型 |
同一支 MV 裡混用不同模型是常規操作,不是妥協。前一陣字節 Seedance 的更新也是同理,我們在 Seedance 原生 4K 對 AI 音樂影片意味著什麼 裡做過同樣的取捨分析。
實用規則: 一支 MV 的預算應該花成金字塔形——80% 的鏡頭用便宜檔位跑通結構,20% 的關鍵鏡頭用旗艦模型定生死。
六、現在就在 SunoMV 用 H3 做一支 MV
不用等公測。在 SunoMV 的影片模型清單裡,Hailuo 03 已經是可選項,參考圖鎖臉、參考音訊對口型、原生 2K 輸出都能直接用上。
四步跑通:
- 先定歌:用 AI 生成一首,或直接上傳你已有的音訊——音樂是整支片子的時間骨架。
- 準備主角素材:給同一個人物準備多角度的圖,正面、側臉、不同光線各來幾張。
- 關鍵鏡頭選 Hailuo 03:把參考圖和這一句的人聲一起給它,其餘鏡頭用更省的檔位。
- 三軌對齊後匯出:歌詞按字級時間戳排到時間軸上,畫面、字幕、鼓點卡在一起再匯出。
歌詞和畫面怎麼精確卡到字,可以看 逐字同步歌詞影片製作指南。想先看別人整體怎麼操作,這支 把 AI 歌曲做成完整 MV 的教學 可以當入門。

常見問題
Q:H3 和 Hailuo 03 是同一個東西嗎? A:是。MiniMax 在 WAIC 2026 上發布的這款影片模型,官方叫 Hailuo 03,對外傳播裡常寫成 MiniMax H3。
Q:我一定要有原唱人聲才能用參考音訊嗎? A:不需要。AI 生成的歌一樣可以當參考音訊餵進去——關鍵是有一段確定的音訊,而不是它從哪來。
Q:15 秒夠做一支 MV 嗎? A:單段夠用。一支 3 分鐘的 MV 本來就是幾十個鏡頭拼的,15 秒對單鏡頭來說已經很長——多數音樂鏡頭 3 到 8 秒就該切了。
Q:只用 H3 做完整片划算嗎? A:不划算。它是旗艦檔位,扣費明顯高於快檔。把它留給副歌和特寫,其餘用便宜檔位,是性價比最高的做法。
Q:為什麼我的口型還是對不準? A:先檢查有沒有真的把這一句的音訊作為參考餵進去。只在文字提示裡寫「跟著唱」是沒用的——模型需要拿到音訊本身。關於口型的通用做法,Hailuo 口型同步指南 有更細的整理。
七、下一步
發布會的熱度一週就過去了,但「把一首喜歡的歌變成一支像樣的 MV」這件事的門檻,正在實實在在往下掉。H3 的價值不在那幾個數字,而在於它把「音訊」和「人物」從後期的麻煩,變成了生成階段的輸入。
現在就去 SunoMV 音訊轉影片生成器,挑上 Hailuo 03,把你最近最上頭的那首歌丟進去,看看副歌那八秒能被拍成什麼樣。
—— SunoMV 團隊