MiniMax Music3 今日发布

上海人工智能公司 MiniMax 于 2026 年 8 月 14 日发布的全新音乐生成大模型

AI音频 部分免费

MiniMax Music3 是上海人工智能公司 MiniMax 于 2026 年 8 月 14 日发布的全新音乐生成大模型,核心突破在于首次实现了最长 5 分钟完整歌曲的端到端生成,填补了 AI 音乐领域长音频生成的技术空白。此前业界主流音乐模型普遍只能生成 30 秒至 3 分钟的片段,完整歌曲生成能力一直是行业性难题。

MiniMax Music3 采用分层自回归架构,由两个核心模块组成:全局语言模型(Global LLM)参数规模为 8B,基于 Qwen3-8B 初始化,逐帧预测第一个 RVQ 码本,负责建模歌曲的长程语义与结构变化;局部语言模型(Local LLM)参数规模为 0.6B,预测每一帧中其余声学码本,恢复细粒度声学信息。两个模块协同工作,确保模型在长音频中保持音乐主题、节奏、歌声身份和编曲推进的一致性。

在输出规格方面,MiniMax Music3 生成的单首歌曲时长最长为 5 分钟,输出格式为 32kHz、16-bit 立体声 WAV 文件,能够覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等完整音乐结构。模型支持根据歌词文本和音乐风格描述生成指定风格的完整歌曲,涵盖流行、摇滚、电子、民谣、古典等多种音乐类型。

MiniMax Music3 已在 GitHub 和 HuggingFace 同步开源,ModelScope(魔搭社区)也已上线,开发者可免费获取模型权重并本地部署使用。Apache 2.0 开源许可证允许商业使用与再分发。该模型的发布意味着音乐创作人、独立制作人和小型工作室无需昂贵的录音棚资源,即可通过文本描述生成具有完整结构的商业级音乐作品,大幅降低了音乐内容生产的门槛。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论