单样本校准、零推理开销,免训练LoRA合并框架上线 | ICML'26

SSR-Merge将多个LoRA合并从参数空间的硬碰硬转变为子空间信号路由,在零额外推理开销下实现无训练合并,解决多概念多主体生成的严重串扰难题。

量子位于 2026 年 9 月 9 日 发布了这篇报道,介绍 vivo BlueImage Lab 与南京大学等团队在扩散模型轻量化微调领域的一项新突破。研究团队提出了名为 SSR-Merge 的免训练 LoRA 合并框架,把以往依赖人工调参的权重混合转变为数学上的信号路由,在消除多任务串扰的同时保持了零额外推理开销。作者署名:vivo BlueImage Lab 投稿 量子位 | 公众号 QbitAI。1
转载说明:保留原文标题、报道内容和主要表述,清理微信阅读器导航、关注引导、二维码及与理解无关的页面残留。正文配图完整采用微信原文中能辅助理解机制与实验的真实图表,并配简短图注。

为什么多个 LoRA 合并容易“打架”

LoRA(Low-Rank Adaptation)是目前主流的轻量化微调技术:开发者保持基座模型权重冻结,只训练一对低秩矩阵,就能让扩散模型掌握特定角色、画风或图像编辑操作。随着开源社区积累了海量 LoRA 模块,将多种能力融合成单个模型的需求变得十分迫切。1
以往的合并手段普遍在参数空间进行数值运算。直接相加的任务算术(Task Arithmetic)最容易发生参数覆盖;TIES 和 DARE 等稀疏化方法先剔除部分参数再合并,实质上是通过削减单项任务能力来换取整体稳定。
为了展现这种底层干扰,研究团队记录了合并模型在接收不同任务指令时的激活响应。理想状态下,指令只应唤起对应的特定模块,形成清晰的对角线结构。
传统合并与SSR-Merge的任务激活热力图对比
左侧传统合并方法(DARE)的激活图大面积泛红,显示模块之间存在严重串扰;右侧 SSR-Merge 仅激活目标模块,呈现规整对角线。1
测试显示,传统稀疏化方法合并后的模型,单条指令会同时唤醒大量无关模块,信号在共享参数空间里互相干扰。针对这一症结,SSR-Merge 将解决冲突的重心从参数空间转移到了特征信号的调度上。1

信号路由三步走:给内部通道装上交换机

SSR-Merge 的全称是子空间信号路由(Subspace Signal Routing)。该方法无需重新训练模型权重,整个流程由三个步骤构成:合并通道、解混、导航。1
在合并通道阶段,算法将 K 个 LoRA 的下投影矩阵沿秩维度拼接,同时将上投影矩阵横向拼接,构成统一的子空间,使全部任务的特征进入同一条扩展通道。
在解混阶段,针对各路混合信号,算法借助少量校准数据运行一次前向传播,统计各通道信号的相关结构得到相关矩阵 G。通过乘以逆矩阵 G⁻¹,系统依照统计规律分离纠缠的混合成分。
在导航阶段,算法构建方向引导矩阵 Q,将解混后的第 i 路信号精准对准第 i 个 LoRA 对应的出口,避免信号串入其他任务通道。
SSR-Merge路由器结构与信号流向
SSR-Merge 将多个 LoRA 子空间合并为统一通道,路由器 R=QG⁻¹ 先进行去相关解混,再将纯净信号引导至各自任务出口。1
最终构建的路由器形式为 R = QG⁻¹。它的作用类似于网络交换机,负责将每路数据流准确调度至对应的输出端口。论文在理论上证明,该路由器数学上等价于普通最小二乘(OLS)估计量的投影,属于让合并后特征重建误差最小的解析解。1

工程落地优化:单样本校准与零推理开销

为了让这套数学推导切实可用,研究团队在工程实现上完成了三项针对性设计:
单样本校准(one-shot calibration):算法仅需为每个任务提供一条代表性文本提示词,运行一个前向时间步即可收集所需统计量,无需完整训练集与真值图像。
流式计算架构:借助充分统计量的可加性,系统边读取数据边累加协方差,原始特征即时释放,将内存复杂度压缩至常数级 O((Kr)²)。
结构化重参数化:部署阶段将路由器 R 直接吸收融入上投影矩阵中,合并后的模块在结构上仍保持标准 LoRA 形式,可直接并入底座模型,实现零额外推理开销
实测数据显示,在 FLUX.1-dev 底座上合并覆盖全部 Transformer 层的 9 个 LoRA 时,SSR-Merge 耗时为 34.26 秒,运算效率明显优于稀疏化合并方案。1

实验验证:单任务保真度与多任务同图组合

研究团队围绕合并性能设计了三个层次的评估实验。
第一个问题考察合并后单个任务的留存能力。在 DreamBooth 数据集上训练 10 个主体 LoRA,将目标任务与 2 至 8 个随机干扰 LoRA 进行合并。在干扰最大的 9 模块合并测试中,SSR-Merge 取得 0.6713 的 DINOv2 相似度与 0.7850 的 CLIP 分数,在各类规模下均保持单任务上限 90% 以上的能力恢复率。1
第二个问题考察同图多主体生成的组合能力。团队构造了 100 条要求同时生成 2 至 4 个指定主体的复杂指令,并使用 Grounding DINO 进行目标检出与打分。
多任务同图生成实验数据对比
多任务同图生成评估中,SSR-Merge 的生成成功率达到 91%,显著高于对比基线。1
实验中 SSR-Merge 的主体完整生成成功率达到 91%,相比 DARE 提高了 29 个百分点,验证了信号路由机制在应对复合需求时的稳定性。1
第三个问题考察多属性图像精细编辑任务。团队将口红、腮红、眼影三个独立编辑 LoRA 一次性合并,在 100 张 FFHQ 人像上测试上妆表现,并以专业修图软件串行处理的结果作为参照基准。
多属性人像编辑效果对比
人像精修测试中,Task Arithmetic 编辑几乎未生效,TIES 妆效微弱,DARE 出现唇色过度偏浓失衡,SSR-Merge 则保持了三项属性的均衡呈现。1
在定量评价中,SSR-Merge 的 ArcFace 身份保持度达到 0.9610,CLIP 综合一致性达到 0.9625,各项指标均位列对比方法首位。此外,附录测试表明,在 K=21 的超大规模合并以及 GLUE 自然语言理解基准上,该方法同样取得了稳定的测试分数。1

方法局限与安全边界

研究团队在报告中客观指出了该方案的适用边界:
首先,SSR-Merge 优化的是局部线性特征重建目标,在完整的非线性扩散推理过程中不提供全局最优保证,极端场景下仍可能出现局部特征偏差。
其次,当合并的多个任务之间存在强烈的领域冲突或高度语义重合时,特征信号在统计上难以清晰剥离,路由调度的有效性会受到影响。
此外,更高效的多概念生成能力也会降低合成图像的门槛,潜在增加误导性内容的生成风险,团队建议在合法合规的前提下审慎应用。1

原文引语

研究团队在总结中阐述了这项工作对开源生态的两点核心判断:1
LoRA 合并是“能力资产化”的关键一环。社区里数以万计的 LoRA 是真正的资产——每一个背后都是数据、算力和审美调校。但资产只有能组合才有复利。
对于算法演进方向,团队指出:1
这个领域该从“调参的艺术”走向“统计估计的科学”。凡是有“多个增量模块共享一个底座”的地方,路由视角都值得尝试。
相关学术与代码资源:

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado

More from this channel