一篇于 7 月 20 日提交的论文,把「已有录音的风格修改」拆成两步:先将源音频确定性反演到潜空间,再用目标提示词生成编辑结果。1
FlowSonic 的重点是保留原曲结构。方法会复用反演阶段的 cross-attention 表示,并用 Dynamic History Caching 初始化三阶 Adams–Bashforth 求解器。2
作者在音色迁移和风格修改任务上报告:语义对齐、和声保留、结构一致性与感知音质都优于现有音乐编辑方法。论文正文的轨迹图能说明 solver 的路径差异,但它不是音频质量分数。2
对创作者来说,先拿短片段试验,再逐项回听目标风格、和声、段落结构和整体听感。研究结果不能直接等同于已可用的商业产品,提示词设计、反演误差和强引导下的伪影仍要自己验收。




Comments
Sign in to comment.