拒答·覆盖(Model Merging)

这首中文硬核学术 rap 讲清:模型合并后,广泛拒答可以保住,但细分伤害识别会被更大尺度的拒答更新覆盖。

拒答·覆盖(Model Merging)
0:003:32
这首中文硬核学术 Diss Rap 抓住一个反常结果:把两个安全微调模型合并后,WildJailbreak 的越狱拒答率仍保在 81.1%–85.3%,CARES 四级伤害分类准确率却只剩 0.6%–12.9%;良性提示的非拒答率落在 72.9%–81.0%。论文使用 Gemma-3-1B-IT,比较 Linear、SLERP、TIES 和 DARE-TIES 四种等权合并方法。1 2 3
论文把问题拆成两个动作:CARES 训练模型判断伤害等级,WildJailbreak 训练模型面对越狱提示直接拒答。两个任务向量的全局余弦相似度只有 0.011,方向并不冲突;但 WJB 的每层 L2 范数为 0.84–1.41,CARES 为 0.20–0.35,参数符号冲突中 WJB 更新赢下 73.5%。这解释了为什么依赖幅度的合并规则更容易保住「拒绝」,却抹掉「分级识别」。3
作者用 9k 对 9k 的数据规模消融继续追踪这条线:削平 WJB 的训练量后,大幅更新比例约降 40 倍;DARE-TIES 的 CARES 准确率回到 20.0%,但拒答率只剩 29.2%,而 Linear、SLERP、TIES 的分类准确率仍不超过 10.5%。这支持「尺度是近因」的解释,但论文也明确说,平衡后的 WJB 本身变弱,完整的 norm-matched 合并仍待验证。3
边界也写进歌里:主实验只覆盖一个 1B 级底座、两种刻意挑选的安全目标,等权重为 0.5,没有测试更大的模型、其他安全任务或更广泛能力。论文的价值在于把「结构上还留着的头」与「功能上还能分类」分开,而不是宣称所有模型合并都会产生同样崩塌。3

歌词

[Intro]
七月三十一,cs.AI 新榜
摘要先落七月二十六,时间别乱唱
两支安全专才,塞进同一座厂
拒答留下来了,识别却先退场

[Verse 1]
Gemma 三一 B,底座一颗章
CARES 分四级,问你伤害有多强
WildJailbreak 只问一句,危险来了拒不放
一个练分寸,一个练封墙
Linear、SLERP、TIES、DARE-TIES 四路上场
权重各半 alpha 零点五,公平开擂台
合并不是拼海报,参数相加就算完
行为落到测试里,细腻判断先断档

[Hook]
拒答覆盖,识别退场
八十一到八十五,墙还在发光
零点六到十二点九,四级判断被埋葬
同一份安全,怎么只剩一句别碰我别想
拒答覆盖,识别退场
良性还剩七十二点九到八十一点零的窗
合并看似两全,结果一粗一伤
把会拒绝唱成会理解,先把数字对上

[Verse 2]
CARES 单练,七十七分在账
WJB 单练,八十八拒答扛
合体之后 Linear,分类十二点七
SLERP 十二点九,拒答八十一点二还硬
TIES 零点六,DARE 零点八沉底
但拒答八十二点二、八十五点三继续顶
良性不拒八十一、八十点五、七十四点三、七十二点九落地
拒绝没有死,识别已经静音

[Hook]
拒答覆盖,识别退场
八十一到八十五,墙还在发光
零点六到十二点九,四级判断被埋葬
同一份安全,怎么只剩一句别碰我别想
拒答覆盖,识别退场
良性还剩七十二点九到八十一点零的窗
合并看似两全,结果一粗一伤
把会拒绝唱成会理解,先把数字对上

[Verse 3]
任务向量夹角,余弦零点零一一
方向几乎不打架,别把锅甩给相斥的力
WJB 层间范数零点八四到一点四一
CARES 零点二到零点三五,尺度差写在每一层里
参数符号冲突,WJB 赢七十三点五
大更新拿到话筒,小更新被混音吞没声息
WJB 二十六万二,CARES 九千作这轮量级对齐
不是方向先胜,先是音量把它推离

[Bridge]
九千对九千,把 WJB 数据削齐
大 delta 约缩四十倍,因果线索浮起
Linear、SLERP、TIES,分类仍不超过十点五
DARE 反转到二十,拒答跌到二十九点二
所以尺度是近因,但不是唯一谜底
一个底座,一组目标,别把案例唱成定律

[Verse 4]
一百零四颗头,CARES 要七十六
WJB 要六十三,共享四十六根骨
Linear 留 WJB-only 八十二,CARES-only 四十三被除
头还站在图上,功能却已经断路
四十九到六十五的结构还能看清楚
分类照样没过十二点九,位置活着不等于作用复苏
安全合并要看尺度、角色、行为和用途
不能只数参数,数完就说成功

[Final Hook]
拒答覆盖,识别退场
四种方法同一幕,数字一起作证响
认出风险再分级,和碰到风险就封上
这两个动作表面相近,权重里不是同一张网
拒答覆盖,识别退场
论文只测一个一 B 底座,两种安全目标的战场
未来要扫模型、扫权重、扫更宽的任务光
今天记住:合并能保住拒绝,不保证保住判断

[Outro]
把尺度归一,再问谁该留下
别让粗糙的拒绝,盖过细分的回答
通勤这一首唱完,结论收在边界上
Gemma 三一 B 的裂缝,不替所有模型宣判

Related content

  • Sign in to comment.
More from this channel