

Suno 把模型锁在云端,9 月 3 日起连 Pro 用户每月都只能下载 20 首。Music3 不一样——模型权重在你硬盘上,没有次数限制,想生成多少首就生成多少首;歌词和音乐描述全程不上传,隐私自己掌控;自定义社区协议允许生产(作品个人用),年营收超 2000 万美元才需要找 MiniMax 单独授权。这是「模型在你手里」的自由,跟「借你听的云端生歌」完全是两回事。

Music3 用的是 Hybrid-LM 分层自回归架构:上层 8B Global LLM(从 Qwen3-8B 微调)管歌曲的长程结构——前奏、主歌、预副歌、副歌、桥段、间奏、尾奏一气呵成;下层 0.6B Local LLM 填每一帧里剩下的声学码本,把细节一点点补回来。再加上 2.4B Flow Matching + 123M Flow-VAE 把隐藏状态直接合成音频——全局结构不丢、局部细节拉满,5 分钟长音频稳稳守住主题。

官方推荐 1×H200(80GB+),但普通用户门槛没那么高。满血 24G(RTX 4090/5090)跑得最顺畅,60 秒歌 20 秒出;8GB 显存也能跑,开 CPU offloading 后模型分批搬上 GPU,代价是速度变慢;6GB 框架自动管理。ComfyUI 用户最方便——最新版原生支持 Music3,下载 4 个模型文件(diffusion + text encoder + VAE)拖入工作流即可,社区还有一键整合包解压即用。

硬件决定速度,24G 满血环境下实测:60 秒歌曲约 20 秒出;4-5 分钟完整歌曲 1-2 分钟(另一份测试显示 3 分钟歌曲约 219 秒)。同一段中文歌词同一句描述——Music 3.0 生成耗时 64 秒、成片 1 分 49 秒;2.6 版本 46 秒、成片只有 1 分 9 秒。慢 18 秒换来的是更完整的歌曲结构,而不是「凑时长」。音质上大致在 Suno V3.5 水平,在开源界已经是天花板。

Music3 并不接受“来首悲伤的歌”这类笼统表述。官方推荐采用三段式结构化提示词,具体如下:其一为全局信息,涵盖音乐流派、每分钟节拍数(BPM)、调性、情绪走向以及收听场景等方面;其二为人声细节,包括演唱者性别、音色特点、演唱风格以及和声运用情况;其三为编曲与段落,涉及主奏乐器以及每个段落乐器的变化。
对于歌词,需运用段落标签标注结构,例如 [Intro] [Verse 1] [Pre - Chorus] [Chorus] [Bridge] [Outro]。若你不知如何撰写,MiniMax 官方设有 Skill 提示词生成器,你只需输入主题,便可自动生成结构化描述与歌词。
当你浏览完五张图后,哪一点最令你心驰神往呢?是开源权重赋予你“模型在手”的自由之感,还是 24G/8G 显存阶梯让你摩拳擦掌、跃跃欲试?亦或是你早已搭建好 ComfyUI,只待集成 Music3?请在评论区告知小编你的部署计划
小编每日都会在此守候最新鲜的 AI 动态,点击关注,以免错过精彩内容。咱们明日再会~ 【AI览无余】