答案听起来一样,电路可能完全不同Capítulos1×0:08开场1:41方法3:32实验5:46案例7:08意义8:38局限10:03收尾0:0010:570:08主持人今天这篇论文的标题很直白,叫 Shared Semantics, Divergent Mechanisms,中文可以理解成:语义可以共享,机制却可能分叉。它问的是一个在 mechanistic interpretability 里很容易被忽略的问题:如果两个回答听起来几乎一样,我们能不能默认它们是同一条内部计算路径产出的?0:32研究员论文和项目页给出的直觉例子很有意思。同一个问题,模型可能回答同一个歌手名,也可能换一种说法;从语义 embedding 看,两个回答非常接近。但从 prefix 到 continuation 的 attribution signature 看,它们可能离得很远。反过来,两个表面答案不同的 continuation,内部归因结构却可能更接近。0:59主持人这就是本期的切入点。过去很多 circuit analysis 是 target-conditioned,也就是拿一个 prompt,加一个你选定的 completion,然后解释模型为什么走到这个 completion。这个范式很清楚,但也有一个问题:它把一整片可能回答压成了一个点。1:19研究员对。论文摘要说得很明确:单个目标答案会遮住 continuation distribution 里的异质性。模型不是只会给一个答案,它会在一组可能续写之间分布概率。我们如果只解释其中一个,很可能解释到的是某个局部样本,而不是模型在这个问题上真正分成了哪些回答模式。1:41主持人这篇论文提出的方法,名字是 distribution-level unsupervised feature discovery。听起来有点长,我们先拆开。第一步,它不是手工指定目标答案,而是对同一个 prompt 采样很多可能 continuation,并且保留它们的概率权重。2:01研究员第二步,每个 continuation 会被表示成两种视角。一种是 semantic embedding,回答它说了什么。另一种是 sequence-level mechanistic attribution signature,回答哪些 prefix feature 在把模型推向这个 continuation。项目页把它说成两个视图:一个看含义,一个看内部支持信号。2:26主持人第三步是聚类。它用 rate-distortion objective,也就是率失真目标,在语义一致性、机制一致性和簇的复杂度之间做权衡。不是先拍脑袋说要分几个簇,而是从一个簇开始,只有当拆分真的显著降低失真,才保留更多模式。2:49研究员这里最关键的是,它不是纯语义聚类,也不是纯归因聚类。纯语义会把听起来一样的回答放在一起,但它们可能不是同一个机制。纯机制又可能得到人类很难读懂的分组。论文的目标是找到一组既可读、又有机制一致性的 continuation modes。3:11主持人所以这篇论文其实在换分析单位。它不再问「这个 token 为什么被预测出来」,也不只问「这个单独 completion 的 circuit 是什么」。它问的是:在同一个 prompt 的回答分布里,有哪些可解释的回答模式?这些模式背后有没有可干预的内部方向?3:32研究员根据 arXiv 摘要和项目页,论文的默认复现实验是 AmbigQA 加 Qwen 三代八 B 模型,代码仓库也把这套 pipeline 作为默认设置。AmbigQA 很适合这个问题,因为很多问题本来就有歧义,模型可能沿不同解释路径继续回答。3:55主持人项目页有一个很清楚的现象:在语义空间里看起来很干净的簇,放到机制 attribution 空间里会混掉;反过来也一样。也就是说,一个 clustering view 看起来漂亮,不代表另一个 view 也同意。4:12研究员这点对 interpretability 很重要。我们经常为了方便,把「答案意思差不多」当作「模型内部做的是同一件事」。但这篇论文提醒我们,语义相似不是 circuit 相似的可靠代理。两个答案都说「由制作公司出钱」,可能一个内部方向抓的是节目预算,一个抓的是电视台或制作方身份。4:37主持人那它怎么证明这些簇不是漂亮的可视化,而是有机制意义?论文用了 steering,也就是干预。对每个发现出来的簇,它选一个代表性的 medoid,从这个代表 continuation 中取 top B attribution features,然后在原来的 prefix 位置和层上放大或压低这些 features。5:01研究员如果这个簇真的代表一个 cluster-level causal factor,放大这个方向,簇内其他 held-out continuation 的目标 logit 应该一起升高;压低时应该下降。项目页展示的结果是,RD 方法的 medoid direction 有最稳定的单调响应。语义 K-means 基线接近零,单独随机 continuation 的方向只部分迁移。5:28主持人这个对比很漂亮。语义 K-means 失败,说明只按意思分组会把不同机制混到一起。随机单个 continuation 较弱,说明只解释一个样本又太窄。RD 簇的优势在于,它试图找到一整组回答共享的内部因素。5:46研究员项目页给了一个 renovation 的例子。问题是:Holmes Next Generation 的装修谁付钱?模型的一个回答模式是 production funding,也就是制作公司或电视网络出钱。另一个模式是 not recognized,也就是否定前提,说这个项目名称并不被广泛承认或没有正式记录。6:10主持人这两个模式不只是文字标签不同,而是可被 steering 区分。项目页里,production funding 的 RD medoid 方向被放大后,held-out continuation 的正向响应达到百分之百;而单个随机 continuation 的方向就弱很多。not recognized 模式也类似,RD medoid 比随机源更稳定。6:33研究员这给听众一个很具体的理解:所谓 cluster-level feature,不是「某一句话里出现了某几个词」。它更像一个回答模式背后的方向。这个方向可以把模型往一整类回答推过去,而不是只复现一个表面字符串。6:50主持人也正因为如此,这篇论文和传统 circuit tracing 的关系不是替代,而是前置筛选。你可以先用它把一个 prompt 的回答空间分成几个模式,再决定哪一个模式值得做更细的 token-level circuit analysis。7:08研究员我觉得这篇论文的最大意义,是把 interpretability 的入口从「我选一个目标」变成「模型自己暴露出几个目标候选」。这对审计很有价值,因为很多高风险问题的危险点,不是模型最常见的回答,而是分布尾部里某些少数但机制明确的模式。7:32主持人比如同一个医学、法律或事实问答 prompt,模型大多数时候可能给标准答案,但少数 continuation 会走向含糊、错误归因或前提否定。如果我们只解释一个主答案,就会错过这些分支。7:49研究员另外,它也给 mechanistic interpretability 和 behavioral evaluation 之间搭了一座桥。行为评估告诉你模型输出了什么,circuit analysis 告诉你某条路径怎么发生。这篇论文试图在中间放一个层:先把输出分布整理成可读、可干预的 continuation modes。8:13主持人从工程角度看,代码仓库也值得注意。仓库说明它保留了从预处理、branch sampling、attribution graphs、feature extraction、clustering、semantic graphs 到 validation 的复现阶段,并且默认配置是 AmbigQA 加 Qwen 三代八 B。这说明论文不是只给概念图,而是留下了可跑的窄复现链路。8:38研究员但边界也要讲清楚。项目页自己的 caveats 说,RD clusters 应该看作有用的机制假设,不是完整 circuit explanation。它干预的是 sampled continuation 上的平均 demeaned logit,和常规 next-token circuit tracing 不是同一个 estimand。8:59主持人成本也不低。它要为很多 sampled continuation 计算语义 embedding 和 mechanistic attribution summary。如果 context 很长,或者模型更大,计算会变重。对日常审计来说,这可能更像一个重点样本的分析工具,而不是随便扫全量线上流量的工具。9:21研究员还有一个标签问题。簇看起来可读,不代表标签天然可靠。一个 cluster 可能混着答案身份、措辞风格、hedging 程度和格式习惯。人类仍然要检查:这个簇到底是在讲内容差异,还是只是在讲语气差异。9:40主持人所以本期可以把结论压成一句:这篇论文不是告诉我们已经能自动读懂完整电路,而是提醒我们,解释之前先别太快选目标。模型面对同一个 prompt 时,可能有多条语义和机制交错的回答分支;先把这些分支找出来,解释才不容易解释错对象。10:03研究员如果把最近几期串起来看,很多工作都在挑战 interpretability 里的默认捷径。消融可能被 backup circuit 补位,线性探针可能读到格式,自评可能少读上下文。而这篇论文挑战的是另一个捷径:不要把一个选定答案当成整个回答分布。10:24主持人这也是它值得精读的原因。它没有声称解决所有电路解释问题,但它把一个很基础的前置问题讲清楚了:在你追踪电路之前,先确认你追踪的是哪一种回答模式。否则答案听起来一样,电路可能完全不同。今天就到这里,我们下期继续精读 interpretability 前沿。