MiniMax正式发布Music3音乐模型,开源长文本生成完整歌曲
随着AIGC音频赛道持续升温,MiniMax近期正式推出新一代开放权重音乐生成模型Music3,突破传统AI音乐只能生成短片段的局限,支持最长5分钟结构化完整歌曲生成,为人声编曲、短视频配乐、游戏音频创作带来全新解决方案。

一、Music3核心能力:生成具备完整结构的长音频
过往多数AI音乐模型普遍存在短板:歌曲时长受限、段落割裂、前后旋律风格突变,很难产出符合商用标准的完整曲目。MiniMaxMusic3针对性解决长音频连贯性难题。
用户仅需输入文字风格描述与歌词,模型一次性完成作曲、编曲、人声演绎与音频制作。生成歌曲覆盖前奏、主歌、预副歌、副歌、桥段、间奏、尾奏完整段落。音频输出为32kHz、16-bit立体声WAV文件,达到基础工业化制作标准。
同时模型优化人声生成效果,还原演唱气息、转音、和声细节,弱化机械合成感,能够匹配流行、影视配乐、轻音乐等多元曲风创作需求。
二、分层混合架构,解读Music3底层技术优势
Music3采用全局+局部Hybrid-LM分层自回归架构,分工清晰实现长时序音乐创作。
1、8BGlobalLLM全局模型:依托Qwen3-8B初始化,负责把控整首歌曲整体框架、情绪走向与长程结构,保证整首曲子主题统一,避免旋律断层。
2、0.6BLocalLLM局部模型:逐帧填充乐器音色、人声细节等精细化声学信息,丰富编曲层次感。
除此之外,模型搭载多层RVQ量化、Flow-Matching与Flow-VAE音频渲染方案,平衡音乐宏观结构与声音细节。最受行业关注的是,Music3开放权重,开发者可在本地部署运行,不必完全依赖云端API,降低音乐创作者、开发团队的使用门槛。
三、Music3落地场景,赋能多元创作者群体
Music3面向不同类型创作者开放能力,应用场景十分广泛:
独立音乐人可以快速制作歌曲Demo,快速验证创作灵感,缩短词曲创作周期;短视频、自媒体从业者批量生成无版权背景音乐;游戏、影视团队快速产出场景配乐、插曲;AI开发者基于开源权重二次微调,搭建专属音频生成工具。
对于中小创作者而言,开源属性是一大亮点。相较于闭源AI音乐产品,本地部署模式更好保障音频素材数据安全,适合有长期稳定音频产出需求的团队。
四、AI音乐行业迎来新竞争,开源路线成为趋势
近几年文本生成音乐技术快速迭代,各大厂商不断更新模型能力。MiniMaxMusic3的发布,补齐MiniMax在音频生成领域的版图。长时长完整歌曲+开放权重的组合,也让开源AI音乐赛道竞争进一步加剧。
当然现阶段AI音乐依然存在局限,复杂和声编排、高度个性化曲风创作仍有提升空间。但不可否认,Music3进一步降低音乐创作门槛,推动AIGC音乐从“趣味工具”转向正式生产力工具。
未来随着模型持续迭代,本地运行门槛持续降低,更多音乐从业者将借助AI工具提升创作效率。MiniMaxMusic3的问世,也预示着兼具高质量、可本地化部署的开源音频模型,将成为行业重要发展方向。
闽公网安备 35021102000564号