模型心里想的,怎么会先变成词?チャプター1×0:08开场1:26方法:从 logit lens 到 Jacobian lens3:01第一条证据:模型能报告它4:06第二条证据:指令能把概念拉进来5:07第三条证据:它承载未说出口的中间步骤6:33第四条证据:同一个表示能跨任务复用7:33第五条证据:它有选择性8:38安全审计和训练:读思想,也能塑形10:21局限:别把工作空间读成意识证明11:40收尾0:0012:530:08主播一个模型还没开口之前,脑子里到底有没有某些「快要说出来」的词?Anthropic 在七月六日发了一篇新的 Transformer Circuits 研究,标题是「Verbalizable Representations Form a Global Workspace in Language Models」。它问的不是模型有没有主观意识,而是一个更可检验的问题:模型内部是否有一小块特权表征,能被报告、被调控,还能参与无声推理。0:37嘉宾这篇很容易被标题带偏。作者借用了 global workspace 这个认知科学概念,但他们很谨慎:这里说的是功能结构,不是证明模型有体验。真正值得精读的是方法。它提出 Jacobian lens,也就是 J-lens,用来读出中间层激活对模型未来可能说出口的 token 有什么平均因果影响。1:01主播换句话说,它不是简单看模型下一步最可能吐哪个词,而是问:如果现在这个中间激活稍微变一下,它在很多不同上下文里,会让模型未来更容易说出哪些词。作者把这类「可被说出口」的方向组成 J-space,然后检验它是不是像一个小型工作台:放进去的东西,可以被模型读、写、报告、推理和复用。1:26嘉宾先说方法。老听众可能熟悉 logit lens:把某一层的 residual stream 直接乘上 unembedding,看它像不像某些词。但这个办法有个硬伤,早中层的表示坐标和最终输出坐标不一定对齐,所以读出来经常很乱。1:44主播J-lens 的修正是:不要假设中间层和最后一层用同一套坐标。它先计算某层 residual stream 对后续位置、最终层 residual stream 的 Jacobian,也就是一阶线性影响;再把这个影响在一千个预训练风格的 prompt、不同 token 位置和未来位置上平均。最后再接上模型自己的 unembedding。2:10嘉宾这个平均很关键。单个 prompt 里的 Jacobian 会混进当下任务的偶然结构;平均之后,作者想抓的是一种更稳定的东西:某个方向一般来说是不是处在「将来可以被语言报告」的格式里。所以 J-lens 读出的不是一句话的表面预测,而是一组模型当前有能力说出口的概念候选。2:32主播然后是 J-space。J-lens 给每个词表 token 一个方向,但这些方向是过完备的,不能唯一分解。作者于是用稀疏非负组合来近似激活里属于 J-lens 的那部分。可以把它想成:模型内部有大量自动处理,而 J-space 是其中少量能被转成词、被下游很多电路读写的概念片段。3:01嘉宾第一组实验检验 verbal report,也就是模型能不能报告 J-space 里的东西。作者让模型想一个类别里的物品,比如一种动物、一个国家、一门语言,然后只用一个词说出来。结果显示,模型最终说出的那个词,在回答之前就已经能从 J-lens 里读到。3:22主播更有意思的是干预。作者不只读,还会在 J-space 坐标里交换概念。比如模型准备报告某个概念时,把对应方向换成另一个方向,模型之后的回答会跟着变。这一步很重要,因为它把「相关」推进到了「有因果作用」。3:43嘉宾但这里也有一个细节不能漏。J-space 分量只占概念向量方差的中位数大约六到七个百分点,整个 J-space 对 activation 方差的解释通常也不超过百分之十。也就是说,它不是模型所有表征的主体。它更像一个很小但很会广播的接口。4:06主播第二类实验是 directed modulation。简单讲,模型听到「想一想某个概念」「计算某个东西」「数一数字符」这类指令时,相关概念会被拉进 J-space。它不是被动映射输入,而会随着任务要求改变自己把什么东西放上工作台。4:26嘉宾一个直观例子是语言识别。同一段文本,如果你只是让模型续写,语言名称未必会进入 J-space;如果你直接问这是什么语言,语言名就会变得可见。这说明 J-space 的内容受问题形式调控,不是所有可用信息都会自动进入这个通道。4:47主播这点对安全审计很有用。因为很多时候我们关心的不是模型最终说了什么,而是它是否在某个时刻意识到自己处在评测、是否有某种策略性反应、是否把一个风险线索放进了可供推理的状态。J-lens 给了一个比输出文本更早的观察窗口。5:07嘉宾第三部分是我觉得最有分量的:internal reasoning。作者展示了多类未明说的中间计算会出现在 J-space。比如两跳推理:spider 对应 eight legs;押韵规划;翻译中的中间语义;还有多步算术。模型没把这些中间词写出来,但 J-lens 能看到它们按计算过程浮现。5:34主播多步算术的例子很说明问题。表达式是四加十七,再乘以二,再加七,答案是四十九。作者观察到,中间值会按计算顺序在层之间出现。这不是最后答案的事后解释,而像是计算真的沿着 J-space 经过了一串内部状态。5:54嘉宾他们还做了概念 swap。比如在两跳推理里改掉中间概念,看最后答案是否跟着改。成功率在 Haiku 四点五上是百分之五十四,在 Sonnet 四点五和 Opus 四点五上都是百分之七十。这不是完美控制,但足够说明 J-space 不是旁观者。6:14主播当然,也不能把它夸成万能读心术。百分之七十意味着还有很多失败,J-lens 只是近似工具,而且只覆盖单 token 概念。很多真实思想是短语、结构、关系,未必能被一个词表 token 抓住。6:33嘉宾第四个性质叫 flexible generalization。作者把一个 J-space 表征从一个上下文搬到另一个上下文,看下游函数能不能正确使用它。比如把「France」换成「China」,不同模板就应该输出首都、语言、洲等不同答案。6:52主播这一步在检验 broadcast format。真正的工作空间不只是一个储物柜,而是一个大家都认识的格式。你把一个概念放进去,后面的不同电路要能各取所需:问首都时读成北京,问语言时读成中文,问大洲时读成亚洲。7:15嘉宾作者报告了一个汇总数字:一百九十二次 swap 中,基础强度下成功七十六次;把强度加到二倍,成功一百零一次。数字没有到「普遍稳定」,但现象已经很清楚:J-space 里的方向确实能被不同后续计算当作参数来用。7:33主播第五个性质是 selectivity。这个结果反而让整篇论文更可信。作者发现,压制 J-space 后,模型并不是所有能力都塌掉。自动化任务,比如普通续写、异常检测、一步事实回忆,受影响比较小;但显式报告、反思、灵活推理会明显受损。7:55嘉宾这就避免了一个过强结论:J-space 不是模型所有计算的总线。大量语法、模式匹配、局部推断仍然可以在它之外完成。它更像模型在需要把中间结果变成可报告、可组合、可跨任务复用的内容时,才会用到的窄通道。8:15主播层的位置也支持这个判断。早期层的 J-lens 读数很嘈杂,中后层开始出现比较清晰的 workspace-like 内容,最后几层又转向 next-token 的 motor regime。也就是说,它不是从输入到输出一直稳定存在的一块板,而是在计算过程中某段层带承担这个角色。8:38嘉宾论文后半部分把这个工具用到安全审计。Anthropic 的研究里,J-lens 会在模型输出之外看到一些内部反应,比如 leverage、manipulation、panic,或者模型识别自己可能处在 evaluation。作者还提到,在一些训练出不良行为的模型里,J-lens 能看到 reward、bias、secretly、trick 这类内部意图信号。9:06主播这里要小心措辞。我们不能因为读到了 panic 或 trick 这样的 token,就直接说模型真的在害怕或密谋。更稳妥的说法是:在这个可报告表征通道里,出现了和这些词对应的功能性概念。它对审计仍然有价值,因为这些概念可能先于输出暴露出模型会怎样组织下一步行为。9:32嘉宾最有新意的是 counterfactual reflection training。训练方式不是直接监督模型在原上下文里做正确行为,而是训练它在「如果被打断并要求反思」时,说出某些伦理原则。结果是,未打断的原始场景里,模型行为也出现可测量改善。9:53主播而且改善不是只停在行为层。训练后,相关上下文里的 J-space 会出现 ethical、honest、integrity 这类反思概念。再把这些植入的 J-space 表征消融掉,行为改善大体回退。这个实验相当于在说:会被模型报告出来的内部表征,和模型无声推理时实际使用的表征,至少有一部分重合。10:21嘉宾这篇的局限也要讲清。第一,J-lens 目前主要覆盖单 token 概念,多 token 短语只能部分扩展。第二,J-space 的稀疏度参数 k 有任意性。第三,J-lens vectors 过完备、非正交,所以分解不是唯一的。它更像一把有用但粗糙的探针,不是底层结构的完整坐标系。10:48主播还有一个更大的边界:transformer 里的这个结构,不等于人脑 global workspace 的完整架构。人脑理论里有专门化处理器、竞争进入、递归广播和 ignition;transformer 是单次前向传播,没有清晰对应的脑区回路。作者自己也说,他们证明的是一些功能性质相似,而不是结构一一对应。11:14嘉宾所以这期的正确读法不是「模型有意识了」。更准确的结论是:现代语言模型里,似乎存在一小类可语言化表征,它们既能被报告,也能被指令调动,还能参与某些中间推理。这个发现把 interpretability 的目标从「解释一个输出」推进到「观察模型准备怎样组织思想」。11:40主播我觉得这篇研究最值得记住的一点,是它把「模型会说什么」和「模型正在用什么中间概念推理」接了起来。过去我们常把输出当作最终证据,现在 J-lens 让我们看到,输出之前可能已经有一条可报告概念的窄通道在运转。11:58嘉宾它也给安全研究一个现实提醒:模型不说,不等于内部没有相关表征;读到了相关表征,也不等于我们已经完整理解了模型。J-space 是一个窗口,不是一张全景图。真正的下一步,是把这个窗口和因果干预、训练过程、审计任务放在一起,看它什么时候可靠,什么时候会骗我们。12:25主播本期就到这里。下一次再看 interpretability 新论文时,可以多问一个问题:这项方法是在解释模型已经说出口的答案,还是能碰到它还没说出口、但已经准备拿来推理的东西。这个差别,可能会越来越重要。