AI 写歌不再只有高潮!MiniMax 发布 Music3,一键生成 5 分钟完整单曲

一直以来,AI 音乐生成领域都有一个难以逾越的痛点:生成的音频往往只是几十秒的片段,或者缺乏完整的起承转合。今天,MiniMax 正式打破了这一僵局,推出了全新的音乐生成模型 MiniMax-Music3。只需输入简单的歌词和音乐风格描述,它就能为你创作出长达 5 分钟的完整歌曲,让 AI 音乐创作真正迈向“单曲级”可用标准。

专业级音质与教科书般的歌曲结构

对于音乐创作者而言,音质和结构是作品的灵魂。MiniMax-Music3 能够直接输出 32kHz、16-bit 的立体声 WAV 文件,确保了声音的清晰度与后期处理的专业度。

更令人惊喜的是它对歌曲宏观结构的精准把控。官方表示,该模型能够完美呈现一首标准歌曲的所有组成部分——从前奏、主歌、预副歌、副歌,到桥段、器乐间奏乃至尾奏,可谓“一个不落”。在长达 5 分钟的生成过程中,模型能稳稳锁定音乐主题、节奏律动、歌手音色以及编曲的层次推进,彻底告别 AI 音乐常见的“虎头蛇尾”或“中途跑偏”问题。

8B+0.6B 双剑合璧:揭秘分层自回归架构

如此出色的长程控制力,得益于 MiniMax 采用的分层自回归架构。这套系统由两个分工明确的模型“上下配合”完成:

  • Global LLM(全局语言模型,8B 参数):这是整个架构的“总导演”。它基于 Qwen3-8B 初始化,在训练时通过适配音乐语义词元,专门负责逐帧预测第 1 个 RVQ 码本。它的核心任务是构建歌曲的长程语义与结构骨架,确保整首歌的逻辑严密。
  • Local LLM(局部语言模型,0.6B 参数):这是负责细节的“乐手”。它专注于预测每一帧中其余的声学码本,将细粒度的声学信息一点点填补回来,为骨架注入丰满的声音血肉。

这种“大模型管结构骨架,小模型填声音血肉”的精妙分工,不仅大幅提升了长音频的生成质量,也展现了极高的工程优雅度。

立即体验

目前,MiniMax 已经开放了 MiniMax-Music3 的模型页面,并提供了多首生成的歌曲示例供大家试听。无论你是独立音乐人、视频创作者,还是对 AI 音乐感兴趣的开发者,都可以去亲自感受一下这款模型带来的听觉震撼。

🔗 模型及示例试听地址MiniMax-Music3 on HuggingFace

类似文章