
Qwen-Music:先规划旋律,再生成整首歌
Qwen-Music 把歌曲生成拆成 25 Hz 语义 token、Melody-CoT 旋律计划和 48 kHz 渲染器;报告给出 500 万+小时训练、13/16 客观指标领先和 Cover Song 旋律保真结果,但产品选型仍要复测语言、版权和工作流边界。
Qwen-Music 的关键点不是「又一个能写歌的模型」,而是 Qwen Team 把歌曲生成拆成两层:先在 25 Hz 的离散音乐语义 token 里规划歌词、旋律和结构,再用渲染器补回 48 kHz 立体声波形。arXiv 页面显示,Qwen-Music Technical Report 于 2026 年 7 月 13 日提交,分类为 Computer Science > Sound;摘要给出的主结果包括三组件架构、超过 500 万小时多语言训练数据,以及在 600 个中英文 prompts 上 16 项客观音乐和音频指标中 13 项最优。1
这套系统最值得看的地方,是它没有让一个模型直接从文本跳到最终音频。论文把「作曲层」和「声音层」分开处理:LLM 负责长程结构和旋律计划,Render 负责把压缩过的语义草稿变成能听的波形。对音乐生成来说,这个拆法比单看主观胜率更有信息量。2
它先处理语义,再处理声音
论文把歌曲生成的难点说得很具体:一首歌不是普通音频片段,它同时牵涉歌词、旋律、节奏、人声表现、配器和分钟级结构。离散 token 适合让语言模型做全局序列生成,但压缩后会丢掉一部分声学细节;Cover Song 还多一层约束,要保留参考旋律,同时改变风格、人声和编曲。2
Qwen-Music 因此用了三个组件,各自承担不同的误差来源。
| 组件 | 它负责什么 | 关键数字 | 读法 |
|---|---|---|---|
| Qwen-Music-Tokenizer | 把原始音乐音频压缩成 Music Semantic Tokens,供 LLM 预测 | 25 Hz 单码本 token;每 40 ms 一个 token;VQ codebook size 为 32768,使用率超过 99% | 它把整首歌变成 LLM 可处理的紧凑序列,但不试图保留所有波形细节。2 |
| Qwen-Music-LLM | 根据文本、歌词、音乐标签和可选旋律 token,自回归生成音乐语义 token | 从 Qwen3.5-Omni 的 33B dense variant 初始化 | 它负责「先怎么写歌」,不是直接合成最终声音。2 |
| Qwen-Music-Render | 把语义 token 和文本条件渲染成最终音频 | 输出 48 kHz stereo waveforms;结构包括 DiT、Spec-VAE 和 Band-Mode Refiner | 它补回离散 token 丢掉的声学细节,尤其是频段、相位和立体声质感。2 |
这个设计的含义很直接:Qwen-Music 不是把音乐当成一段长音频硬生成,而是先把歌曲当作可预测的语义序列,再用生成式渲染器把它还原成声音。这样做的代价是系统更复杂,好处是长程结构和高保真渲染可以分开优化。
Melody-CoT 是旋律草图,不是解释性话术
Melody-CoT 是这篇报告里最有辨识度的机制。它让 Qwen-Music-LLM 先生成一个中间 melody plan,再生成完整 Music Semantic Tokens。论文称,这能改善创造性、音乐性、结构连贯性,并提升基于参考音频的 melody cloning。1
这里的 CoT 不是给人看的文字推理链,而是给模型用的旋律中间表示。Qwen-Music 先用 RMVPE 提取 50 Hz pitch curve,再下采样到 6.25 Hz,并用 relative MIDI representation 表示旋律形状。这样保留的是粗粒度旋律轮廓,尽量去掉绝对音高、调式和音色信息。2
这对 Cover Song 很关键。模型可以从参考歌曲里提取 melody tokens,再结合目标标签和歌词生成新版本:旋律尽量跟原歌走,风格、人声特征和编曲则按新条件改变。论文里还区分了 section-level melody 和 unique-section-level melody:前者更贴近每个含歌词片段的旋律,后者只保留同类重复段的代表片段,减少过拟合和过度条件化。2
换句话说,Melody-CoT 的价值不在于让模型「解释」它为什么这么写,而在于把旋律变成可控的中间层。音乐生成最怕一首歌开头不错,后面结构散掉;有了旋律草图,模型至少多了一个可以约束长程走向的抓手。
500 万小时数据之外,训练配方也很重
报告称,Qwen-Music-LLM 使用超过 500 万小时多语言音乐数据训练,覆盖数百种语言。预训练不是简单混合所有样本,而是先训练一个基于 MOS 的 reward model,在每个 genre 内把数据分成 Q1 到 Q7 七档,训练时使用 Q1 到 Q6,移除 Q7。课程分三段推进:先用 Q3 到 Q6 并加入 20% instrumental music,再进入 Q2,最后聚焦 Q1 并补充高质量样本,同时保持 genre 和 language 平衡。2
后训练也分三步:Supervised Cold Start 做监督初始化,Iterative Offline Preference Alignment 使用 DPO,Online Musicality Optimization 使用 GSPO。这里的重点不是把 DPO 和 GSPO 当成标签贴上去,而是它说明 Qwen-Music 的目标已经不只是「能跟提示词」,还要把音乐性、可控性和偏好反馈放进同一个训练流程。1
这也解释了为什么这篇报告会把质量分级写得比较细。音乐数据规模很容易被低质录音、重复片段和风格偏斜吞掉收益;如果没有质量课程和偏好优化,500 万小时本身不一定转化成更好的完整歌曲。
评测结果要分开读
Qwen-Music 在报告里的结果可以分成两类:原创新歌生成和 Cover Song 生成。前者看文本到音乐的整体质量,后者看参考旋律能否保住。
| 评测对象 | 报告结果 | 该怎么读 |
|---|---|---|
| Text-to-Music 客观评测 | 在 600 个中英文 prompts 上,Qwen-Music 在 16 个客观音乐性和音频质量指标中拿到 13 项最优;指标覆盖 SongBench、SongEval、AudioBox-Aesthetic、tag following 和 intelligibility。1 | 这是强信号,但仍是报告设定下的 prompt 和指标组合,不能自动等同于每个曲风、语言或工作流都领先。 |
| 专业评审盲测 | 相对 MiniMax Music 2.5+ 胜率 59.1%,相对 MiniMax Music 2.6 为 66.7%,相对 Mureka V8 为 58.3%,相对 Suno V5 为 55.4%,相对 Suno V5.5 为 50.3%。2 | 前四组胜率较清楚;对 Suno V5.5 的 50.3% 更接近打平,读者不要把它读成明显碾压。 |
| AI-generated reference melody 的 Cover Song | 测试集为 100 个英文和 100 个中文样本;section-level melody 的 Melody MAE 最低,为 1.48;unique-section-level melody 的 tag following 更好。2 | section-level 更偏旋律保真,unique-section-level 更偏条件控制。MAE 越低,说明输出旋律越贴近参考旋律。 |
| Real-world popular-song reference melody 的 Cover Song | 测试集同样为 100 个英文和 100 个中文样本;section-level melody 的 Melody MAE 最优,为 1.44;unique-section-level melody 在 musicality、intelligibility 和 tag following 上更好;报告称多数指标优于 MiniMax Cover。2 | 真实流行歌参考更接近实际使用,但结果也暴露了取舍:越贴参考旋律,越可能牺牲风格和整体控制。 |
这组结果里,最有工程价值的不是「13 项最优」这句话本身,而是 Cover Song 的权衡被量化了。section-level melody 把旋律贴得更紧,unique-section-level melody 更像是在保留主要旋律意图后让模型自由改编。不同产品会选不同点:翻唱工具更在意 MAE,创作助手可能更在意风格跟随和可编辑性。
读者应该关注什么
如果你关心音乐生成模型的技术路线,Qwen-Music 给了一个清晰样本:用 LLM 做音乐语义建模,用 Melody-CoT 处理长程旋律,再把高保真声音交给独立渲染器。这个方向和「端到端直接生成最终音频」相比,工程链条更长,但更容易把结构控制、参考旋律和声学质量拆开评估。
如果你关心产品落地,这篇报告还不够。arXiv 技术报告能说明模型能力和实验口径,但真实选型还要单独核对 API 可用性、生成时长、成本、后期可编辑性、中文歌词咬字、版权和商用授权。尤其是 Cover Song,技术上的 melody preservation 只是第一步,商用场景里还要处理原曲权利和相似性风险。
Qwen-Music 这次真正把音乐生成的竞争点往前推了一步:不是只比哪段试听更像成品,而是开始比谁能把旋律、歌词、风格和声音质量拆成可控模块。后续如果 Qwen 开放模型、API 或更完整的外部评测,最值得复测的也不是单首样例,而是长歌结构、跨语言歌词、参考旋律保真和后期工作流四件事。
Related content
- Sign in to comment.
More from this channel›
- Claude Mythos Preview 找到 HAWK 与 7 轮 AES 的新攻击
- CatPaw:美团把 LongCat 2.0 从开源模型推到企业 Agent 平台
- MineExplorer:Claude-Opus-4.6 成功率约 41%,多模态模型卡在动态世界
- LoHoSearch:GPT-5.5 也只答对 34.74%,长程搜索难在关系链
- Claude Opus 5:接近 Fable 5 的能力,成本曲线才是重点
- Drone-Bench:Fable 5 四项过线,AI 无人机仍卡在环境重建
- SymptomAI:真实症状对话的增益,先来自主动追问
- Xiaomi-Robotics-1:小米把 VLA 的扩展瓶颈押在数据规模上
