把单个权重变成可验证的解释对象:稀疏 Transformer 的逐参数实验

把单个权重变成可验证的解释对象:稀疏 Transformer 的逐参数实验

精读 arXiv:2607.02964:论文用单权重消融、可执行谓词与持出验证测试稀疏 Transformer 的逐参数可解释性,并说明 15.0% 与 0.4% robust rate 之间的差异该如何解读。

先给判断

如果把「可解释」理解成一个人能给出一句自然语言描述,这篇论文的答案并不稀奇;真正有分量的是它把描述变成了可执行的 Python 谓词,再用权重消融和持出文本检验这句话是否真的对应模型计算。对四个语言 Transformer 的比较显示,在相同判据下,稀疏模型里能稳定通过验证的非零权重明显多于稠密模型。1
但这不是「模型内部已经被解释」的证据。论文测量的是:在给定语料、谓词语言、自动解释模型和阈值下,一个权重的作用能否被短规则稳定描述。这个定义很窄,却比只看激活或只在单一任务里命名一个特征更容易复核。我的判断是:这篇预印本值得读,尤其适合作为「如何给可解释性加上泛化门槛」的案例;它还不能替代面向高层行为的 circuit analysis。

它把解释对象从电路换成了单个权重

机械可解释性通常从一个目标行为出发,再寻找参与该行为的组件或路径。本文反过来处理:不先指定任务,直接取一个非零权重,问它在什么输入位置上真正有作用。论文作者 Arnau Marin-Llobet 和 Stefan Heimersheim 于 2026 年 7 月 3 日将 v1 提交到 arXiv。1
具体流程从消融开始。研究者把一个权重设为 0,分别运行原模型和消融模型,比较每个 token 位置上的预测差异,用逐位置 KL divergence 找到该权重最影响哪些上下文。随后把这些高影响上下文交给语言模型,让它生成形如 f(tokens, pos) -> bool 的候选谓词,例如判断当前位置是不是数字、某个词缀,或前文是否出现特定局部模式。
候选谓词不能只在「它见过的例子」上说得通。作者用两类条件消融来打分:谓词成立时恢复该权重,观察原模型损失能恢复多少;谓词不成立时恢复该权重,检查它是否只是把权重到处打开。最终分数取两者中更严格的一项,并要求谓词覆盖的样本不超过 50%。因此,「这个权重在数字 token 上起作用」不是语言模型写得像,而是要在消融实验里把影响位置重新找回来。

持出验证改变了 headline

论文把语料切成不重叠的片段。候选谓词在一部分文本上生成和选择,再到未见文本上重评分;更严格的 robust rate 还要在 10 个持出切片上稳定超过不可解释基线。这个设计很重要,因为自动解释模型很容易从高影响样本中总结出一条漂亮但只适用于该语料的规则。
在阈值 T = 0.75、覆盖上限 c = 0.5 的设置下,正文给出的三种比例如下。Interp_A 是同样本评分,Interp_B 是一次持出评分,Robust 则是跨切片的稳定结果。1
模型Interp_AInterp_BRobust rate
Gao 稀疏代码模型37.3%35.3%15.0% ± 1.7%
Drori 稀疏模型21.4%17.2%9.6% ± 1.1%
Drori 稠密模型13.2%9.0%1.5% ± 0.6%
Pythia-70m12.0%5.0%0.4% ± 0.3%
分母是抽样到的非零权重。结果的关键不在于某个模型恰好达到多少,而在于排序在严格验证后仍然保留:Gao 稀疏模型高于 Drori 稀疏模型,后者又高于同架构稠密模型和 Pythia 稠密对照。摘要把这类结果概括为约 12%–31% 的权重可用单一短描述解释,但读者应优先看更严格的 robust rate,而不是把摘要区间当作普遍适用的模型常数。1

稀疏性带来的差异,主要体现在稳定性

作者还估计了不同权重的解释分数有多少来自权重自身,多少只是抽到某批文本的偶然性。稀疏模型约 85%–90% 的 score spread 被估计为真实的权重间差异;Pythia-70m 只有约 47% 能保留下来。换句话说,稠密模型一次持出测试里看似能解释的权重,重抽样后很容易失效;稀疏模型的解释更像是参数本身的稳定属性。1
这个结果让 sparse/dense 对照比单纯的通过率更有说服力,但还不能写成「稀疏性被证明导致可解释性」。Gao 模型的原始 Python 训练语料并未公开,作者用 CodeParrot 作为代理;Pythia 也只是用 The Pile 的分布匹配评估,并非完全相同的训练序列。Drori 的 sparse/dense 模型提供了同架构对照,仍然存在训练方式、语料和模型规模等混杂因素。论文支持的是稳定的相关性与方法学差异,不是对稀疏性的单变量因果估计。2
三个模型中的单权重解释示例:自然语言描述与可执行谓词对应到高影响上下文
图中展示了三个模型的权重卡片:解释包含一句短描述、谓词代码,以及权重消融和谓词消融在高 KL 上下文中的对照。它说明论文所谓的「解释」是一个可运行的局部规则,而不是对权重语义的自由命名。2

可解释性的边界写在谓词语言里

这套方法能找到的解释,取决于谓词允许表达什么。论文中的典型规则是 token lookup,或附带一两个相邻 token 的条件,很少跨越长上下文维护状态。一个字符串闭合相关的权重就是提醒:只允许 token-local 规则时,最佳解释分数为 -0.98;允许最多回看 8 个 token 后,分数升到 +0.83。前后差异说明「可解释」既是权重的性质,也是测量语言的性质。1
自动解释模型同样是变量。论文用 Gemini 3 Flash、Claude Sonnet 4.5、GPT-5 和 GPT-4o 重跑流程,在 T = 0.75 时绝对可解释率最多相差约 30 个百分点;每个权重生成的候选数量从 1 增加到 150 时,稀疏模型的比例在 N ≈ 100 后趋于饱和。好消息是模型排序在这些设置下没有改变,坏消息是绝对比例显然不能脱离解释器和候选预算单独阅读。1

读完论文后,应该把结论放在哪里

这项工作的贡献,是把「单个参数有无可解释功能」改造成一条可以复跑的证据链:先做反事实式的单权重消融,再让解释器提出可执行谓词,随后在未见文本和多次重采样上检验。它把可解释性从一张好看的 feature label,推进到「描述能否恢复干预影响」这一更硬的标准。
它没有回答三个更大的问题。第一,短谓词能否组合成跨长上下文的高层计算;第二,在训练分布外,权重是否仍保持同一作用;第三,一个权重的作用是否对某个具体模型行为具有必要性。论文展示的是局部作用的充分性线索与跨样本稳定性,不是高层行为的完整因果电路。
因此,这篇论文值得深入读的理由,不是它给出了一个惊人的百分比,而是它把「可解释」拆成了可检验的几层,并用持出验证淘汰了一部分只对语料有效的解释。若要继续追问,下一步应是扩大模型与分布外任务,允许更丰富但仍可执行的谓词语言,并把逐权重结果接回真实行为电路。1

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel