模型为什么这么说,能不能自己拿出训练证据?开场1×1:16原型预测通道2:51训练数据归因为什么快4:04性能和成本5:07原型能不能控制行为6:10局限和意义0:008:020:00主播如果一个语言模型给出一句危险建议、一个版权味很重的续写,或者一个自信但错误的事实,我们真正想追问的是:到底哪些训练材料、哪些内部通道,让这个回答变得更可能?据 arXiv 论文「Prototype Language Models」,作者没有再造一个事后解释器,而是改模型本身:让每次下一词预测,都经过少量可追踪的「原型」。0:30嘉宾这篇论文的系统叫 PRISM,我下面直接叫「原型语言模型」。它的路线和很多 mechanistic interpretability 工作不同:不是等模型训练完,再训练稀疏字典或追踪电路;而是把可解释的中间单元放进输出路径。问题变成:如果模型天生就用一小组训练数据邻域来组织预测,归因和控制会不会便宜很多?0:57主播本期讲四件事:原型到底是什么;为什么训练数据归因能快几百倍;性能有没有明显掉下去;以及最重要的局限:这种透明度不是给现有黑盒模型贴一个补丁就能得到,最强的结构来自从头联合训练。1:16嘉宾普通 GPT 风格模型最后会得到一个 hidden state,再用输出矩阵映射成词表 logits。这个过程很强,但也很密:一个 token 的概率来自很多参数和很多方向叠加。你想问「为什么它更想说这个词」,答案通常散在整个网络里。1:37主播PRISM 改的是最后这段输出路径。据论文描述,它保留 transformer backbone,但加入一组 learned prototypes。每个位置的 hidden state 会和所有原型比较,只保留 top-k 个非负激活,再用这些原型重构 hidden state。解释不了的部分,交给 residual branch。2:00嘉宾换成白话,就是模型先问:当前这个位置,有点像训练中见过的哪几类上下文?这些「像」不是单个样本,而是一组原型向量。每个原型对应训练样本邻域,也对应一个固定的 token 倾向。最后的预测可以拆成「几个原型贡献了什么」加上「残差补了什么」。2:26主播这和 SAE 有相似处,都追求稀疏、可读的中间单元。但区别很关键:SAE 多半是训练后解释隐藏表示;PRISM 是让原型直接参与预测。作者还用 R1、R2 这类聚类目标,让原型靠近真实 token 表征邻域,避免变成虽然能重构、但离训练数据很远的抽象方向。2:51嘉宾论文最有冲击力的结果是训练数据归因。传统影响函数和 Hessian 近似方法,在现代语言模型上又贵又脆弱。PRISM 把问题搬到 prototype space:每个样本只激活少量原型,训练侧信息可以缓存成稀疏记录;归因时不必在完整参数空间里追踪影响,而是比较哪些原型邻域和当前预测最相关。3:21主播据论文报告,在等内存条件下,PRISM 的训练数据归因比 dense 的事后基线快约五百倍;其中一个缓存式 scoring 实验相对 EK-FAC 快四百七十倍。同时,排序信号没有完全丢掉:在一个设定中,它保留了大约百分之八十的 top five percent training sequences。3:43嘉宾这不等于它完美回答「是哪一句训练文本导致这个输出」。更准确地说,它把归因单位从全参数空间里的困难近似,改成少数原型和它们的训练邻域。细节会有损失,但换来可缓存、可查询、可控制的接口。对模型审计来说,这个取舍非常实际。4:04主播可解释 by design 模型最常被问的一件事是:性能是不是换掉了?这篇论文从一亿三千万到十六亿参数做扩展实验,训练 token 最高到五百亿,语料包括 FineWeb-Edu 和 Nemotron-CC 子集。4:21嘉宾论文的主结论是,PRISM 通常能达到或接近匹配的 dense GPT baseline。摘要里说,平均下游准确率要么超过,要么在 dense baseline 的二点五个百分点以内。它不是只在玩具数据上透明,而是在中等规模语言模型上仍然能跑。4:42主播工程开销也不算夸张。论文报告,在 XL 规模下,原型层额外参数大约两千六百二十万,只增加约百分之一点七;吞吐从 GPT 的每秒四万一千五百 token,降到 PRISM 的每秒四万零四百,约保留百分之九十七点三;显存从四十九点一 GB 到五十点九 GB。5:07嘉宾除了归因,论文还展示了两类控制。第一类是 prototype controller:在原型空间里校准一个线性控制器,调整部分原型通道。论文报告,这能带来大约三个百分点的下游准确率提升,同时还能追踪这些修正对应到哪些训练邻域。5:28主播第二类是 suppression,也就是抑制特定原型。论文声称,不需要 finetuning,就可以去除某些模型行为,并且没有可测的生成质量损失。直觉上,如果某个原型承载了你不想要的续写模式,就可以直接压低这个通道,而不是重训整个模型。5:50嘉宾但要谨慎。这更像证明「原型是可操作的控制接口」,还不是完整安全方案。真实模型里的行为通常不是单个原型决定的;压掉一个通道后,模型也可能通过别的通道补回来。它提供的是更清晰的旋钮,不是万能开关。6:10主播这篇论文最重要的局限也很明确:事后把原型头接到 dense checkpoint 上,结构没那么干净。论文说,这样可以保持交叉熵,但原型 grounding 明显不如从头训练。换句话说,PRISM 不是一个随便贴到闭源大模型上的解释贴纸。6:29嘉宾还有 residual branch。PRISM 保留残差,是因为语言建模太复杂,不能强迫少数原型解释一切。残差保证能力,但也意味着解释不是百分之百封闭的。我们能看到原型贡献了什么,还要继续问:残差里有多少关键决策?6:51主播所以我会把它的贡献概括成一句话:它把「模型为什么这么说」从事后侦探题,部分改造成模型结构题。预测过程里已经留下可追踪的原型脚印,归因、控制和抑制就不必完全从零开始。7:10嘉宾而它给领域的提醒是:如果解释接口只是旁路,它可能解释得很漂亮,却不一定解释真正起作用的东西。PRISM 值得关注,正是因为它把接口放进主路径;但接口覆盖率、残差作用和更大规模验证,仍然是后续必须回答的问题。7:32主播本期的 take-away 是:解释性不一定只是模型训练后的维修工作。它也可以是一种架构选择、一种训练目标,甚至是一种未来模型产品应该内建的审计接口。PRISM 还不是终点,但它把问题问得很直接:如果我们从一开始就要求模型能拿出训练证据,它会不会仍然足够强?这篇论文给出的初步答案是:至少到十六亿参数和五百亿 token 的规模,它有希望。