MiniMax Music 3.0 已上线 SunoMV:音质与人声双双换代,实测出歌不到两分钟
MiniMax Music 3.0 已上线 SunoMV:音质与人声双双换代
MiniMax 放出了新一代音乐生成模型 Music 3.0。我们在发布当天完成接入并跑了实测,现在你打开 SunoMV 的创作页,模型列表里就能直接选到它——不需要等,也不需要额外设置。
一、这一代到底升级了什么
按 MiniMax 官方文档的说法,Music 3.0 的改动集中在三处,而这三处恰好都是过去 AI 生成音乐最容易”露馅”的地方:
1. 语义模型升级,减少”跑偏”。 你写”深夜、克制、只留一把钢琴”,上一代很可能给你加满弦乐。3.0 对创作意图的还原更准,官方的说法是减少了 AI 生成常见的意图漂移。对创作者的实际意义是:你少改几版,风格描述真的会被听进去。
2. 音质是这次最大的一跳。 官方原话是不再”挤压、浑浊”,并且支持指定具体乐器和真实演奏技法——比如滑音(slide)和连奏(legato)。这意味着你可以在风格描述里写”电吉他滑音进副歌”,而不只是笼统写”摇滚”。
3. 人声引擎换代。 高频的”数字毛刺”被去掉了,同时把旋律、咬字、换气、和声层次都开放成了可控项。人声一直是 AI 音乐里最容易被听出来的破绽,这一项的提升最直接影响成品能不能拿去发布。
二、我们的实测数据
接入当天我们用同一段中文歌词、同一句风格描述(dream pop、女声、暖色合成器铺底、90 BPM),分别跑了 3.0 和上一代做对照:
| 生成耗时 | 成品时长 | |
|---|---|---|
| MiniMax 3.0 | 64 秒 | 1 分 49 秒 |
| MiniMax 2.6 | 46 秒 | 1 分 09 秒 |
两个数字值得说明:
- 生成耗时多了 18 秒,但换来的是完整度更高的成品。 3.0 把同一段歌词铺成了接近两分钟的结构完整版本,2.6 则收在一分钟出头。对做 MV 的人来说,这个差别很实际——歌够长,画面才有地方展开。
- 纯器乐同样正常。 不写歌词、只给风格描述也能出稳定的纯音乐版本,适合做背景乐和转场。
需要说明的是,音质属于主观判断,上面这组数字只能说明”生成行为”的差异。建议你自己用同一段歌词各跑一次对比着听——这是判断哪个模型更贴你审美最快的方法,也是我们内部选模型时的做法。
三、在 SunoMV 里怎么用
SunoMV 的定位不是”再做一个出歌工具”,而是把一句想法变成一支能直接发的音乐视频。Music 3.0 接进来之后,完整路径是这样:
- 写想法或歌词 —— 只有一句描述也行,AI 会帮你扩写成完整歌词
- 选 MiniMax 3.0 —— 在模型列表里直接选,风格描述里可以写具体乐器和演奏技法
- 生成歌曲 —— 一两分钟内拿到成品,词曲同时到位
- 自动配画面 —— 歌词按段落拆成分镜,逐段生成画面
- 导出竖版 MV —— 直接发抖音、视频号、小红书、TikTok
关键在第 4 步:歌只是原料,MV 才是能被算法分发的成品。 单纯出一首歌,你还得自己找画面、对时间轴、剪辑导出;SunoMV 把这一整段做完了。
下面这张示意图,对应的就是上面这条从歌词到成片的完整路径:

示意图:BibiGPT 团队绘制
四、什么时候该选它
模型没有绝对优劣,只有适配场景。就 Music 3.0 而言,这几类需求最值得优先试:
- 中文歌:MiniMax 在中文咬字和情绪表达上一直是强项,这一代人声引擎升级后更明显
- 对乐器有具体要求:想要”钢琴独奏进副歌""电吉他滑音”这类精确控制,3.0 才听得懂
- 成品要发出去:人声的高频毛刺是最容易被听众察觉的 AI 痕迹,这一项的改善直接决定成片能不能用
如果你只是想快速出个 30 秒片段试水,列表里还有更轻更快的选择;如果要的是能发布的完整作品,Music 3.0 是现在的首选之一。
五、现在就能用
MiniMax Music 3.0 已经在 SunoMV 上线,无需等待、无需申请。 打开创作页,在模型列表里选中它,写下你的第一句歌词——两分钟后你会拿到一首完整的歌,再往下走一步,就是一支可以直接发布的 MV。
上一代 MiniMax 2.6 仍然保留在列表里,喜欢它的音色可以继续用。
关于这个模型的完整说明和常见问题,都整理在 MiniMax Music 3.0 功能页。
热门文章