7月31日 AI音乐 arXiv 深读:VocalRender 让谱面直接长出歌声,SKY-Piano 把钢琴动作和声音放进同一时间轴

7月31日 AI音乐 arXiv 深读:VocalRender 让谱面直接长出歌声,SKY-Piano 把钢琴动作和声音放进同一时间轴

VocalRender 用交错谱面和自回归扩散生成歌声,SKY-Piano 则把钢琴动作、音频、MIDI 与乐谱同步采集;两篇论文分别展示了生成接口和多模态数据的收益,也保留了跨语言、跨演奏者与伪标注的边界。

覆盖窗口与入选判断

本期覆盖 2026 年 7 月 31 日 arXiv 的 new 列表,这是 8 月 1 日 08:15(UTC+08:00)推送时可见的最新完整窗口。cs.SD 页面列出 13 条记录,其中 9 条是新提交、1 条交叉提交、3 条 replacement submissions;eess.AS 页面另列出 5 条记录。本期只把直接处理音乐生成、音乐信息检索或音乐表演数据的当日新提交纳入正文,不把 replacement 当成首次出现。1 2
两篇入选论文的摘要页显示,VocalRender v1 提交于 7 月 30 日,SKY-Piano v1 提交于 7 月 29 日;它们都出现在 7 月 31 日的 new 列表中。这里按列表日确定本期窗口,不把摘要页的 v1 时间误写成列表日。3 4
入选论文为什么命中范围最强证据需要压低的结论
VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition直接把歌词、音高、谱面音值和速度输入歌声合成,目标是去掉逐音素时长和时间对齐音频的硬约束普通话 in-domain 与 OOD 指标、CMOS/MOS 听测、去掉交错表示的消融主要证据仍来自普通话歌声和作者整理的数据,谱面意图与自动转录之间存在错配
SKY-Piano: A Multimodal Piano Performance Dataset直接为钢琴表演建模提供同步的动作、视频、音频、MIDI 和 MusicXML 数据11 小时、19 位演奏者、真实手部与身体动捕、伪指法审计、MIDI-to-motion 用例参与者和曲目范围有限,指法标签是带歧义标记的伪标注,不是完整人工真值
两篇论文放在一起,指向同一个研究缺口的两端:VocalRender 把音乐家的输入意图压成一种更接近谱面的条件序列,再交给模型生成歌声;SKY-Piano 则把演奏已经发生的动作、声音和符号记录放回同一条时间轴。前者关注生成接口能否让作曲流程少填一层时长标注,后者关注训练数据能否保留表演中 MIDI 看不见的动作信息。

论文一:VocalRender 让谱面直接决定歌声的长度

研究问题

许多歌声合成系统要求用户提前给出音符时长,或者先由一个 duration predictor 预测每个音素要占多少帧。这样的接口适合复现已经对齐的唱段,却不太像作曲:作曲者通常给出歌词、音高、节奏值和速度,不会先写出每个音素在最终音频里占据的精确毫秒数。扩散模型也有一个现实限制:它通常要在生成前知道声学 latent 序列有多长。3 5
VocalRender 的问题设定是:能不能只用作曲者真正会提供的谱面信息,让模型自己决定局部时值和总输出长度,同时保留歌词与音高的对应关系?论文由 Yukun Chen、Tianrui Wang、Zhaoxi Mu、Xinyu Yang 和 EngSiong Chng 完成,分类为 cs.SD 和 cs.AI。它的核心判断不是「时长预测器没有用」,而是把时长从显式输入改成生成过程中的结果。

方法:把歌词和音符交错写进一条序列

VocalRender 的谱面表示包含全局 BPM,以及每个歌词音节对应的一组音符。一个音节可以只对应一个音符,也可以对应多个音高和音值。后者正好覆盖 melisma,也就是一个音节跨过多个音符的唱法。模型把这些内容序列化为「歌词音节,音高,符号音值」的交错 token,而不是把歌词和旋律当作两条互相独立的流。5
VocalRender 的 ARDM 与谱面 token 化:交错的歌词、音高和符号音值进入自回归 Transformer,LocDiT 逐段生成连续声学 latent。
VocalRender 的结构图把「先确定长度、再渲染」改成了「自回归决定生成进度、局部扩散渲染声学内容」;右侧示意了一个歌词音节对应多个音符时的交错表示。6
声学部分使用连续 VAE,把 48 kHz 歌声映射到 25 Hz 的 latent 序列。连续表示避开了离散 codec 量化可能丢失的细微音高、音色和咬字信息。生成器由两段组成:自回归 Transformer 先给出 prosody sketch,并在生成过程中决定何时结束;LocDiT 再对每个 latent patch 做高保真扩散生成。论文的 ARDM 配置约有 1.7B 参数,DiT 约有 0.6B 参数,latent patch 为 4 帧。5
这个设计还保留了可选的参考音频提示。训练时参考片段随机取同一首歌的 2–8 秒,模型因此可以在谱面约束之外学习音色条件。推理时 DiT 使用 10 步扩散采样,classifier-free guidance scale 为 2.0。5

实验设置:规模来自两套 CrawlSinger

论文区分两个版本。VocalRender 使用 2,300 小时以上的 CrawlSinger-OS,数据由 OpenSinger、MuChin、SongFormDB 和 Muse 等公开集合整理而来;VocalRender-Pro 使用 5,600 小时以上的 CrawlSinger。两套数据都经过音节级音高和时值处理。评测包括 Opencpop,以及一个由 2026 年 6 月 1 日之后发布、刻意避开热门重复曲目的 CrawlSinger-Eval,用来观察分布外表现。训练在 4 张 H100 上进行:VocalRender 先做 40k steps 的合成预训练,再做 20k steps 微调;Pro 训练 160k steps。5
论文报告 WER、说话人相似度 SIM、音符区间重合 IOU、音高跟踪 RPA、SingMOS 和 CE。下表只保留 VocalRender 与一个主要基线 SoulX-Singer,便于看清它到底在哪些维度占优,而不是把所有模型名称堆在一起。WER 越低越好,其余指标按论文表头为越高越好。5
评测集方法WERSIMIOURPASingMOSCE
OpencpopVocalRender4.440.9220.620.724.595.85
OpencpopSoulX-Singer5.020.9280.630.774.456.01
CrawlSinger-EvalVocalRender4.520.9190.430.634.535.85
CrawlSinger-EvalSoulX-Singer5.030.9180.540.704.445.71
这张表的读法不是「VocalRender 每一列都赢」。它在两套数据上都把 WER 压到 4.44 和 4.52,SingMOS 也略高;SoulX-Singer 在音高跟踪 RPA、区间重合 IOU 或 CE 的部分组合上更高。VocalRender 的证据更像是:交错谱面和无显式时长的生成没有破坏咬字,并且在新歌曲上保持了相对稳定的歌声质量,而不是在所有音乐维度上统一领先。

主观听测:自然度和风格相似不是同一个分数

主观实验使用 20 多名参与者,包含有音乐教育背景的学生和普通听者;测试池有 1,736 个片段。N-CMOS 与 PS-CMOS 是相对比较分数,0 表示相对参照的中性位置,不能当作绝对自然度;MS-MOS 才是单独的质量评分。5
方法N-CMOSPS-CMOSMS-MOS
SoulX-Singer-0.42 ± 0.28-0.32 ± 0.242.84 ± 0.22
VocalRender002.96 ± 0.22
VocalRender-Pro+0.13 ± 0.27+0.06 ± 0.222.71 ± 0.27
VocalRender 的 MS-MOS 为 2.96 ± 0.22,高于 SoulX-Singer 的 2.84 ± 0.22;Pro 在自然度和 prosody similarity 的相对比较上是正值,但 MS-MOS 反而低于基础版。这个结果提醒读者不要把「训练数据更多」直接翻译成「听感所有维度都更好」。论文给出了平均值和误差,但这张表本身不等于跨语言、跨歌手的普遍听感结论。

消融:交错表示真正影响的是节奏关系

去掉 CrawlSinger-OS 后,Opencpop 上 RPA 相对下降 0.45、IOU 下降 0.13,SIM 下降 0.031;CrawlSinger-Eval 上 RPA 下降 0.40、IOU 下降 0.09,SIM 下降 0.035。去掉交错谱面表示后,两个评测集的 WER 分别增加 0.11 和 0.16,IOU 分别下降 0.05 和 0.04。5
因此,交错 token 的作用不是抽象地「增强了条件建模」,而是把一个歌词音节和它跨越的多音符关系绑在一起。移除它后,歌词识别错误只小幅增加,但音符区间关系变差,说明谱面接口最先影响的是节奏与音符边界的对应。大规模 CrawlSinger 数据则更多改善说话人相似度和旋律相关指标。

局限与适合谁读

VocalRender 目前最需要警惕的是谱面意图和自动转录谱之间的错位。作曲者写的谱面只表达主旋律和节奏结构,真实演唱却可能出现 melisma、拆分音符和装饰音;自动转录谱更贴近音频,却可能带来过细的符号条件、缺少调性和和声约束的音符,以及不常见的音值。模型学到的「score-native」接口因此仍依赖数据整理方式,不能自动等同于真实作曲软件里的谱面。
论文的主要结果集中在普通话歌声、Opencpop 和 CrawlSinger 系列评测。它还需要在更多语言、更多歌手和更复杂的作曲标注上验证,才能回答「不提供时长就能稳定生成」是否是跨音乐文化的接口优势。代码公开信息写在原文中,读者可以从论文页面进入作者提供的项目链接。3 5
做歌声合成、谱面编辑、音乐生成产品或中文歌词控制的人,适合先看表示方式、无交错消融和 OOD 评测;想把它直接用作多语种虚拟歌手系统的人,需要先补齐语言和歌手分布的证据。

论文二:SKY-Piano 把钢琴家的动作放回声音和谱面旁边

研究问题

音频能告诉模型钢琴听起来怎样,MIDI 能告诉模型什么时候按了哪些键,但两者都看不见手腕旋转、重量转移和手指怎样接近琴键。已有钢琴表演数据集要么只有视频推断出的伪动作,要么只覆盖很少的曲目和专业演奏者,难以同时比较技术类型、曲目难度和演奏经验。SKY-Piano 的研究问题是:能否在共享曲目上同步采集真实手部和身体动作,并把它们与音频、MIDI、MusicXML 和多视角视频放在同一个可浏览的时间轴里?4 7
论文作者来自首尔大学、KAIST 和 Yamaha 相关团队,作者列表包括 Joonhyung Bae、Dawon Park、Taegyun Kwon、Yoon-Seok Choi、Hyeon Hur、Satoshi Obata、Shigeru Kai、Yohei Wada、Yu Takahashi、Akira Maezawa、Jaebum Park、Jonghwa Park 和 Juhan Nam,分类为 cs.SD 与 cs.MM。论文称该工作已被 ISMIR 2026 接收。1

数据:19 位演奏者,11 小时同步记录

SKY-Piano 总计 11 小时数据,去重后有 19 位钢琴家,其中 7 位专业演奏者、12 位业余演奏者。受控部分包含 26 个任务项:6 个 Technique 1 动作练习、5 个 Technique 2 音阶/琶音/八度类练习,以及 15 首按难度分组的曲目;另有专业演奏者的自由曲目。Technique 1 和 Technique 2 都覆盖 19 位演奏者,按曲目难度划分的 Set 1 graded 只覆盖 5 位专业演奏者。7
数据流采集配置对 AI 音乐研究的作用
手部动作OptiTrack,8 个红外摄像头,120 Hz,每侧 23 个反光标记保留手指接触、手腕和前臂的细粒度运动
身体动作Qualisys,8 个红外摄像头,120 Hz,17 关节 Visual3D 模型记录身体姿态和重量转移
音频48 kHz、24-bit WAV与动作和符号事件对齐,保留实际发声
MIDIYamaha Disklavier 直接记录力度、时间和踏板提供按键事件与演奏控制信号
视频4 路同步摄像机,4K/60 fps;专业组发布版做面部匿名化让动作、琴键和姿态可以回看
同步30 fps SMPTE timecode;早期 session 另做事后对齐把多模态数据绑定到共同时间轴
后期 session 用硬件 timecode 给不同设备写入同一帧索引;更早的记录通过手腕速度的互相关完成时间对齐,并逐个 trial 人工核验。音频与 MIDI 还做了 CQT-based alignment,论文引用的精度约为 3 ms。空间上,研究者用肩膀、肘部和手腕的 6 个双侧标记做加权正交 Procrustes 对齐,并用键盘两端的 4 个固定标记统一跨 session 坐标。7

预处理:把不可靠数据保留下来,而不是悄悄抹平

数据发布同时保留两种 motion:flagged form 在遮挡处保留缺失或不可靠标记,imputed form 用 SAITS 重建这些片段。全语料共有 565 个 piece-level hand CSV 和 46 个 marker channel;近端标记的缺失率约为 6%,拇指腕骨相关标记最高到 44%,语料中位缺失率为 14%。这使使用者可以按任务选择保守数据或插补数据,而不是把插补值误当作真实动作。7
每首 MusicXML 先由 Parangonar 与演奏 MIDI 自动对齐,再由 musicologist 逐首检查。曲目切分依赖 MIDI 静音间隔,曲目身份用 pitch-class 与 IOI n-gram hashing 匹配后,再和录音日志人工交叉核对。对动作建模来说,这些步骤比「数据量有多少小时」更关键:时间轴和曲目身份错一处,模型就会把手势、音符和声音学成错误的对应关系。7

指法标签:有用,但不是人工真值

SKY-Piano 的指法是 pseudo fingering。方法把 PianoVAM 的几何评分迁移到真实动捕,用音符发声时指尖是否位于目标琴键内、深度是否最低来判断候选手指,再用音符起点附近的 z 轴证据细化多候选情况,最后用 BiLSTM 补全残余歧义。每个发布音符保留 algorithm、imputed 或 null 的来源标签。7
在 113,023 个专业组 MIDI 音符中,91.4% 的音符在 ±50 ms 内有指尖进入目标键区,并且低于键面 15 mm。人工审计覆盖 3 首 Set 1 graded 曲目、2,269 个音符;几何方法加起点细化在 94.0% coverage 的 committed subset 上达到 94.5% 严格精度。另一个 trial-level holdout 上,BiLSTM 恢复算法标签的准确率为 84.3%。这些数字支持「标签可用于建模」的判断,却不支持把全量指法当成逐音符人工真值。7
SKY-Piano 的交互式浏览器把乐谱、动捕骨架、视频、音频、MIDI 和运动学曲线放在同一时间轴中。
这张原图呈现的是数据集最直接的使用方式:读者可以在同一位置对照某个乐句的谱面、琴键动作、音频波形、MIDI 事件和身体运动,而不是分别打开互不对齐的文件。7

用例:数据集能不能帮助动作生成模型跨出原训练集

论文用 MIDI-to-motion 生成做一个代表性测试。Tipiano 接收 MIDI 事件和伪指法,输出键盘坐标系下 120 Hz 的手部标记轨迹。实验采用 professional cohort 的 5-fold leave-one-pianist-out 方案,并同时报告 key-contact F1 和 MPJPE。7
设置Key-contact F1MPJPE
Tipiano 在 Für Elise 上的 in-domain 结果0.91032.8 mm
直接 zero-shot 到 SKY-Piano0.9365.9 mm
用 SKY-Piano 微调0.6648.8 mm
表面上看,微调后的 F1 低于 zero-shot,但 MPJPE 从 65.9 mm 降到 48.8 mm,下降 25.9%。论文把这种冲突归因于指尖定义不同:Tipiano 使用 MANO joints,SKY-Piano 的数据使用指甲上的物理标记。也就是说,微调确实改善了轨迹位置误差,但 key-contact F1 受测量约定变化影响,不能单独用这一列判断迁移失败。7

开放性、局限与适合谁读

论文称数据已按逐模态 consent 获得公开发布许可,并提供数据集、交互式浏览器和处理代码;专业组视频发布前做了面部匿名化,motion 同时提供 flagged 与 imputed 两种版本。读者可以从论文页面进入项目入口,检查不同模态的浏览和下载边界。4 7
局限也很清楚:19 位参与者仍是小样本,曲目主要来自技术练习和西方古典曲目,没有覆盖 extended techniques;指法标签主要是伪标注,人工审计只覆盖 3 首作品。动作数据的精度和模态同步很有价值,但它还不能代表不同文化、不同钢琴类型或更广泛演奏风格的表演分布。
做钢琴动作生成、演奏分析、音频到 MIDI、表演理解或多模态 MIR 的研究者,适合先看采集与对齐细节,再决定是否使用 flagged 或 imputed motion。做音乐产品的人则应把它理解为一套能连接动作和声音的研究数据基础,而不是已经验证过的通用钢琴演奏模型。

放在一起看:接口和数据轴线各自解决一半问题

VocalRender 和 SKY-Piano 都没有把「音乐」当成一条单独的波形。VocalRender 把歌词音节、音高和符号时值交错编码,让模型在生成声学 latent 时自行决定局部和总时长;SKY-Piano 把谱面、MIDI、音频、动作和视频同步记录,让研究者可以反过来观察一个音符怎样被身体实现。一个在减少作曲输入的标注负担,一个在补回音频和 MIDI 缺失的动作证据。
两篇论文的数字也不应混成同一种「效果」:VocalRender 的 4.52 WER、2.96 ± 0.22 MS-MOS 和去掉交错表示后的指标变化,回答的是生成质量与条件接口之间的关系;SKY-Piano 的 11 小时、91.4% 指法覆盖和 48.8 mm MPJPE,回答的是数据能否支持一个动作生成用例。前者仍需跨语言和跨歌手复验,后者仍需扩大参与者、曲目和人工标注范围。
对读者来说,最值得带走的不是「一个模型」或「一个数据集」已经解决了 AI 音乐的哪一大类问题,而是两种可复用的检查方式:生成模型要问它是否真的降低了创作者输入成本,以及谱面条件是否与听见的时值和咬字一致;多模态数据要问每个模态是否在同一时间轴上、缺失和插补是否被明确标注,以及下游指标是否被坐标定义变化搅乱。

Related content

  • Sign in to comment.
More from this channel