AI音乐 Arxiv 精选深读2026-08-017月31日 AI音乐 arXiv 深读:VocalRender 让谱面直接长出歌声,SKY-Piano 把钢琴动作和声音放进同一时间轴VocalRender 用交错谱面和自回归扩散生成歌声,SKY-Piano 则把钢琴动作、音频、MIDI 与乐谱同步采集;两篇论文分别展示了生成接口和多模态数据的收益,也保留了跨语言、跨演奏者与伪标注的边界。
AI音乐 Arxiv 精选深读2026-07-317月30日 AI音乐 arXiv 深读:音素对齐让翻唱少念错,混合 stem 检测仍会误报人声MPEcho 用音素边界把翻唱歌词 PER 从 45.62% 降到 18.65%,另一篇论文则把混合歌曲中的真实人声误报从 94.7% 降到 26.2%,但两组结果都受限于数据构造和场景范围。
AI音乐 Arxiv 精选深读2026-07-307月29日 AI音乐 arXiv 深读:零样本检测看见生成器指纹,双耳分离指标却可能听错空间两篇 7 月 29 日新列论文分别检验未知 AI 音乐生成器的频谱伪迹,以及双耳源分离指标是否真的符合听者的空间感知。
AI音乐 Arxiv 精选深读2026-07-297月28日 AI音乐 arXiv 深读:MSST 的分离工程与和声风格共演模型MSST 把音乐源分离的训练与推理选项统一为可消融管线;另一篇论文用和弦表示与线性动力学追踪 1875—1940 年跨文化风格共演,本文区分两者的可验证收益与因果边界。
AI音乐 Arxiv 精选深读2026-07-287月27日 AI音乐 arXiv 深读:Music-JEPA 建模动作到声音,Reflector 跟随编曲更新和声检索Music-JEPA 用演奏动作学习钢琴声音的状态转移,Reflector 用编曲中的和声上下文更新样本检索,本文比较两者的模型机制、定量结果与证据边界。
AI音乐 Arxiv 精选深读2026-07-257月24日 AI音乐 arXiv 深读:全曲生成拆开规划与渲染,歌声伴奏改用离散扩散两篇修订论文分别用规划加渲染、整段离散掩码扩散处理长音乐,本文用自动指标、盲测、消融和听测说明它们各自真正证明了什么。
AI音乐 Arxiv 精选深读2026-07-247月23日 AI音乐 arXiv 深读:RIME 让代理学会改混音,翻唱诊断发现「在调内」仍可能和声失效RIME 把音乐后期制作拆成可调用的工具链,另一篇论文则用五维诊断显示 AI 翻唱最常坏在和声进行与编配,而不是简单跑调。
AI音乐 Arxiv 精选深读2026-07-237月22日 AI音乐 arXiv 深读:量子代理如何互相传送旋律,音频模型为何还会靠文字猜答案两篇新论文从相反方向检验 AI 音乐:一篇把量子传送变成多代理即兴机制,另一篇用音频依赖过滤揭开模型在音乐问答中的文字捷径。
AI音乐 Arxiv 精选深读2026-07-227月21日 AI音乐 arXiv 深读:SongSQA 让演唱质量变成时间曲线,HARP 让 codec 按谐波分层深读 SongSQA 如何用片段伪标签和整曲聚合评估演唱质量,以及 HARP 如何用频带分组和累积解码改善低码率音频 codec 的谐波一致性。
AI音乐 Arxiv 精选深读2026-07-217月20日 AI 音乐 arXiv 深读:StemFX 学混音风格,DTW 估计对齐可靠性深读 StemFX 如何把混音风格变成可执行的 FX 链,以及 DTW 可靠性指标为何能标出应当谨慎使用的对齐片段。
AI音乐 Arxiv 精选深读2026-07-197月17日 AI音乐 arXiv 深读:ITGPT 把节奏游戏谱面拆成全局步位与局部步型深读 ITGPT 如何用层级 Transformer 先预测节拍落点、再生成四方向步型,并比较它在谱面准确率、长按处理和生成速度上的真实收益。
AI音乐 Arxiv 精选深读2026-07-187月17日 AI 音乐 arXiv 深读:WanSong 的 25B 长歌生成,和 MIDI-RAE-JEPA 的层级表征深读 7 月 17 日 arXiv 新增的 WanSong 与 MIDI-RAE-JEPA:前者把长歌曲生成推进到双 stem 与可编辑接口,后者检验符号音乐表示的层级结构、等变性和下游迁移。