7月17日 AI 音乐 arXiv 深读:WanSong 的 25B 长歌生成,和 MIDI-RAE-JEPA 的层级表征

7月17日 AI 音乐 arXiv 深读:WanSong 的 25B 长歌生成,和 MIDI-RAE-JEPA 的层级表征

深读 7 月 17 日 arXiv 新增的 WanSong 与 MIDI-RAE-JEPA:前者把长歌曲生成推进到双 stem 与可编辑接口,后者检验符号音乐表示的层级结构、等变性和下游迁移。

先说结论

本期覆盖 arXiv 在 2026 年 7 月 17 日公布的 cs.SDeess.AS 新增列表,筛选直接落在 AI 音乐生成、音乐表示学习或音频生产链路上的论文,再回到论文原文核验方法和实验。最终入选两篇:一篇把目标推向「五分钟、多语言、可分离人声与伴奏」的长歌曲生成;另一篇则不直接追求成品音频,而是研究如何让符号音乐表示同时保留层级结构、可重建性和可生成性。两者代表的是 AI 音乐里两条不同的工程路线。1 2
论文为什么入选读者应重点看什么
WanSong v1.0 Technical Report把长时生成、双 stem 输出和推理加速放进同一个纯扩散框架25B 规模的生产化取向,究竟由哪些实验支撑
MIDI-RAE-JEPA用音高/时间平移等变性约束学习层级符号音乐表示表示的不同层级分别学到了什么,以及它能否迁移到下游任务

1. WanSong:先把歌曲生成拆成可编辑的两条轨

它要解决什么问题

长歌曲生成同时受三个约束牵制:生成时间要足够长,音乐和歌词要保持连贯,还要让后期制作可以分别处理人声和伴奏。论文把 WanSong 定义为一个纯扩散模型,目标是一次生成最长 5 分钟的多语言歌曲,并直接输出 vocals 与 background music 两条 stem;论文还宣称通过 step-distillation 加快推理,并为下游编辑提供微调路径。这里的「commercial-grade」是论文标题和摘要中的作者定位,不应直接等同于独立听感评测已经证明了商业可用性。1

方法:低压缩率 VAE 加双 stem token

WanSong 先用连续的一维 VAE 把 44.1 kHz 双声道音频压成连续 latent stream。论文给出的 VAE latent 通道数是 64,时间下采样因子为 1024,对应约 43.1 Hz 的 latent frame rate。这个选择不是单纯为了省 token:作者认为,相比 Stable Audio 2 更低的压缩率能保留更多时间和频率细节,但代价是序列更长、显存和生成时间更高。3
双 stem 设计针对的是一个很具体的失败模式:把人声和伴奏压进同一组 token 后,扩散模型容易过度关注人声,伴奏被压制;提高 CFG 会改善人声的条件遵循,却可能进一步损伤伴奏,降低 CFG 又会反过来。WanSong 因而让 vocals 和 BGM 分开建模、独立生成,同时在网络 block 内以不同通道的方式联合学习两者依赖。它把「分离」从生成后的后处理步骤提前到模型输出接口。3
文本 captioner 产生文本 token,音频则由 VAE 产生连续 token;二者顺序拼接后输入基于 Transformer 的扩散主干。论文称其主干采用 refined hybrid-MMDiT / hybrid-transformer 结构,并使用 fully-shared AdaLN。训练阶段还采用「先 DPO、后 ReFL」的顺序:前者更适合提供逐时间步的偏好监督,后者用于低噪声阶段的细节优化。作者同时提醒,DPO 的 pairwise 信号噪声较大,ReFL 更容易被 reward hacking,因此这不是一个没有副作用的强化学习配方。3
论文称整个模型规模接近 25B,训练数据超过 600 万小时的多语言歌曲;VAE 训练还使用约 2.6×10^8 个音频片段。数据管线包含音频分类、质量评估、结构解析、VAD、语言分类和轨道分离,作者给出的 Music:Speech:Sound 配比为 50%:40%:10%。这些数字说明论文的重点是大规模生产系统,而不是一个只在小数据集上验证概念的原型。3

实验结果:自动指标很强,但要看评测边界

在作者的生成评测中,测试集包含 200 个样本,覆盖中文、英文、日文和韩文,以及 10 多个一级音乐流派;每个样本约 4 分钟。WanSong 的词错误率 PER 为 7.43%,低于表中 LeVo 的 27.11%、MurekaV7.6 的 12.7% 和 SunoV5 的 22.80%。在另一项 musicality 评分中,WanSong 得分 5.49,高于 SunoV5 的 4.18。3
评测对象WanSong对照结果
PER,越低越好7.43%MurekaV7.6:12.7%;SunoV5:22.80%;LeVo:27.11%
Musicality,越高越好5.49SunoV5:4.18
音乐 VAE 重建 SI-SDR,1024 下采样7.246 dBStable Audio 2:4.386 dB
VAE 对照实验也支持低压缩率的取舍:在 200 个音乐片段上,WanSong 的 1024 配置 STFT 为 1.029、SI-SDR 为 7.246 dB;Stable Audio 2 的对应值为 1.430 和 4.386 dB。消融实验进一步显示,实际压缩率从 19.2 降到 15.0 时,主观质量从 2.1 提高到 3.2,但 token 数量、资源开销和生成时间也会随之上升。3
这里至少有三个阅读边界。第一,论文没有在可见实验中给出 step-distillation 带来的具体延迟或吞吐数字,所以「更快」目前只能按作者的框架主张理解。第二,EvalScore 训练于约 2,000 首歌曲,泛化性不容易直接外推;作者因此另用了基于 80,000 首人工标注歌曲训练的 musicality 模型。第三,PER、自动质量分和 musicality 都不能替代跨语言、跨流派的盲听与编辑工作流测试。对产品团队来说,双 stem 接口很有吸引力,但真正的决策变量仍是推理成本、长程结构稳定性和人声/伴奏分离在复杂编曲中的听感。
适合谁读: 关注长音频生成、歌曲产品、后期编辑和大模型推理成本的工程师与产品研究者。若只想找一个轻量的本地模型,论文的 25B 规模和数据需求本身就是重要的反向信号。

2. MIDI-RAE-JEPA:让符号音乐表示对平移有结构化反应

它要解决什么问题

音乐理解不只需要辨认「这段像什么」,还需要知道音高移动、时间移动、密度变化分别如何改变一段音乐。MIDI-RAE-JEPA 研究的是一种自监督的符号音乐表示:不依赖人工标签,让模型从 piano roll 中学习音高与时间的层级结构,同时保留足够信息去重建和生成。论文使用 Scott H. Hawley 的单作者方案,分类为 cs.SDcs.LGeess.AS,并在 arXiv 于 2026 年 7 月 16 日提交 v1。2

方法:把等变性、层级编码和生成接起来

实验输入来自 POP909:909 首流行歌曲的 MIDI 被切成 8 小节片段,每个片段渲染为 128×128 的二值 piano roll。横轴是 64 个八分音符时间步,纵轴覆盖 128 个 MIDI 音高;训练中加入随机裁剪,以及音高和时间平移增强。4
编码器是 6 个 stage 的 Swin Transformer V2,使用 4×4 输入 patch 和大小为 4 的局部窗口。训练目标由 pitch/time translation equivariance、LeJEPA、masked embedding predictor(MEP)和 SIGReg 组成;EMA teacher 负责提供更稳定的预测目标,另有 soft factorization loss 鼓励音高方向与时间方向在 latent 空间中呈现可分解的几何关系。简单说,模型不只被要求「把片段压缩好」,还被要求对已知的音乐变换作出可预测的表示变化。4
它的 RAE 管线分成三段:先训练 encoder,再冻结 encoder、训练镜像式 Swin/FPN decoder 做 piano-roll 重建,最后用 flow matching 生成模型读取多层 embeddings。生成器会把 conditioning 注入 U-Net,并用 multi-level dropout 训练类似 CFG 的条件生成。匹配条件时,输出应接近输入片段的音高区间和节奏密度;打乱条件后,输出仍可保持音乐上可接受,却不再跟着原片段,说明表示中确实分开了「音乐性」和「与这段输入的对应关系」。4

实验结果:中间层做情感判断,细层保留局部细节

最直观的结果是重建。MRJ-12 的 decoder F1 达到 0.9955;当最大时间平移扩大到 48 时,MRJ-48 降到 0.981,但加入 factorization loss 后的 MRJ-48^ 恢复到 0.9953,超过 DINOv2 的 0.987。这个结果说明,等变性约束不必然以牺牲可逆性为代价,合适的几何约束反而可能帮模型把信息组织得更好。4
在 EMOPIA 的情感识别下游任务中,MRJ-12 的第 3 层表现最好:四分类准确率为 0.488,arousal 为 0.754,valence 为 0.640。作为参照,Haar scattering 的三项结果是 0.411、0.726、0.615,DINOv2 的结果是 0.396、0.712、0.573。这里最值得注意的不是单个最高分,而是层级趋势:过浅的层还没有足够的音乐结构,过深的层更偏向局部细节,第 3 层反而最适合情感这类需要中尺度结构的任务。4
表示层级现象论文结果解释
重建MRJ-12 F1 = 0.9955表示保留了大量可还原的音符信息
情感分类L3:四分类 0.488、arousal 0.754、valence 0.640中间层更适合中尺度音乐语义
音符密度L4/L5 的 R² 分别为 0.991、0.984细层更擅长保留局部统计细节
时间结构各层 Temp R² 最高仅约 0.177,DINOv2 L0 为 0.256时间抽象仍是短板
平移实验还显示,embedding 距离会随音高或时间平移幅度单调增加;不同类型的差分向量接近正交,同类型同方向的向量相对平行、反方向的向量相对反平行。它给出的不是「模型理解了和声」这样的宽泛结论,而是一个更窄、更可检验的证据:模型至少学到了部分符合预设变换规律的几何结构。4

局限:层级结构还没有变成高层音乐概念

论文自己指出,大部分可解释的表示能力集中在更细的层级,较粗层级还没有形成清晰的音乐抽象。数据也主要来自 POP909,并用 EMOPIA 做情感迁移,因此不要把结果直接外推到完整歌曲、复杂配器或真实音频。后续方向包括更大的数据集、spectrogram 输入、改进目标函数,以及 arrangement 和 accompaniment generation 等任务。4
适合谁读: 研究符号音乐表示、MIDI 生成、可解释表征或下游音乐理解的研究者。它不是一个可直接替代歌曲生成器的系统,但很适合作为思考「生成模型应该从什么样的音乐表示开始」的技术样本。

两篇论文放在一起看

WanSong 先把「能否生成一首长歌」推进到工程系统层面,再用双 stem 接口打开后期编辑;MIDI-RAE-JEPA 则先追问「表示空间是否对音乐变换有规律」,把可重建、可分类、可条件生成作为三种检验。前者的核心瓶颈是规模、成本和真实听感,后者的核心瓶颈是粗粒度语义和从 MIDI 到真实音频的迁移。
对研究者而言,这两篇论文共同提示一个值得继续追踪的问题:高质量音乐生成不能只靠更大的生成主干。长音频系统需要可编辑的结构化输出,表示学习系统需要能被生成器真正调用的层级语义。下一步更有价值的评测,不是继续堆一个总分,而是同时检查长程结构、局部可控性、stem 级编辑和跨表示迁移。

原文入口

相似内容

  • 登录后可发表评论。
More from this channel