返回新闻列表
2026-08-15 09:16

MiniMax发布Music3:可输入描述生成5分钟歌曲

MiniMax 发布 Music3 音乐模型:输入歌词和描述,生成最长 5 分钟完整歌曲

核心突破:从“短片段”到“完整长歌”

MiniMax 今日正式推出新一代音乐生成模型 MiniMax-Music3。与以往只能生成短片段或简化编曲的模型不同,Music3 允许用户输入歌词和任意音乐描述,并输出长达 5 分钟的完整歌曲。生成结果以 32kHz、16-bit 立体声 WAV 文件呈现,保证了较高的音频保真度与空间感。

在音乐生成领域,长音频的连贯性一直是个难题。许多模型在生成几秒到十几秒的片段时表现良好,但一旦拉长到数分钟,就容易出现主题漂移、节奏不稳、歌声身份前后不一等问题。MiniMax 官方表示,Music3 在长音频生成中能够稳稳守住音乐主题、节奏、歌声身份和编曲的推进,并且完整保留前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏等结构。

模型能力一览

  • 输入:歌词文本 + 音乐风格/情绪/编曲描述
  • 输出:最长 5 分钟的完整歌曲,结构完整
  • 音频规格:32kHz 采样率,16-bit 位深,立体声 WAV 格式
  • 结构支持:前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏
  • 亮点:长音频下保持音乐主题、节奏、歌声身份与编曲推进的一致性和连贯性

分层自回归架构:大模型管骨架,小模型填血肉

Music3 的核心技术是一套分层自回归(Hierarchical Autoregressive)架构,由两个分工明确的语言模型组成:

全局语言模型(Global LLM)

  • 参数量:8B
  • 职责:逐帧预测第一个 RVQ 码本,负责建模整首歌的长程语义与结构变化
  • 初始化:基于 Qwen3-8B 进行初始化,训练时先让嵌入层和输出层适配音乐语义词元,再与局部模型联合建模全部码本

局部语言模型(Local LLM)

  • 参数量:0.6B
  • 职责:预测每一帧中其余的声学码本,逐步补全细粒度的声学信息
  • 定位:在大模型确定的结构骨架之上,填充具体的音色、和声与质感

这种“一粗一细”的协作方式,让模型既能把握歌曲的整体走向,又能在局部细节上做到高质量还原,从而在长音频生成中保持稳定性和表现力。

技术解读:两个模型如何协同

在自回归生成中,音频被编码为多层次的码本序列(RVQ)。全局语言模型以歌词和描述为条件,逐帧生成第一层码本,相当于勾勒出音乐的“骨架”——包括旋律走向、和弦进行、段落划分等宏观结构。随后,局部语言模型基于这一骨架,逐帧预测剩余的码本层,逐层补全音色、泛音、混响等声学细节,就像为骨架填充“血肉”。两者联合训练,确保高层结构与低层细节的一致。

官方演示与开放

MiniMax 已在 Hugging Face 上公开了模型页面,并提供生成的歌曲示例供用户试听。开发者与音乐爱好者可以前往以下地址查看模型详情和样例:

Hugging Face 模型地址:https://huggingface.co/MiniMaxAI/MiniMax-Music3

总结

MiniMax-Music3 的发布,再次推动了 AI 音乐生成在“完整性”和“结构性”上的进步。通过 8B 全局模型与 0.6B 局部模型的分工配合,它实现了对长篇幅歌曲的稳定控制,并为创作者提供了更接近真实音乐制作流程的生成工具。随着模型开放,我们有望看到更多基于该模型的创意应用出现。

来源: aibase阅读原文

其他新闻

查看全部