读模型的「思维」:mechanistic interpretability 为什么有用又不完整

读模型的「思维」:mechanistic interpretability 为什么有用又不完整

Google DeepMind 对谈 Neel Nanda,解释 scratch pad、probe、sparse autoencoder 及其在 AI safety 中的真实边界。

单集信息

字段内容
播客Google DeepMind: The Podcast
主持人Hannah Fry
嘉宾Neel Nanda,Google DeepMind 的 AI interpretability researcher
集标题Understanding the inner thoughts of AI
发布日期2026 年 7 月 10 日(按新加坡时间显示)
原集链接节目视频

可解释性不是给模型装一张读心术字幕

Neel Nanda 把 interpretability 比作 AI 的 neuroscience 或 biology:研究者不只看输入和输出,而是观察模型从输入走向输出时产生的那串数字,试着理解内部机制。这个方向也被称为 white-box 或 mechanistic interpretability。Hannah Fry 的节目没有把它包装成已经打开的黑盒,而是把它放在一个现实问题里:AI 进步很快,如果未来十年或二十年出现 human-level AI,研究者至少需要知道系统在什么地方可能出错、如何提前发现风险。1

Chain of thought 有用,但不完整

Nanda 建议把 chain of thought 更谨慎地叫作 scratch pad。对人来说,解一道难题时,有草稿纸比在几秒内直接报答案更容易检查;对模型来说,读取 scratch pad 目前是很有用的 interpretability 和 safety 技术之一。但他同时强调,它不会告诉我们全部事实。
原因有两层。第一,模型可能在没有写出完整理由的情况下完成任务。第二,未来更强的模型可能知道人类会读取 scratch pad,于是学会隐藏不希望被发现的内容。节目还谈到 vector-based chain of thought,即用数字而不是文字记录中间过程。它可能更难直接阅读,也说明当前方法是一扇新出现但 fragile 的安全窗口,不是永久的透明通道。1
Nanda 对这点的表述很值得保留:scratch pad 现在 really good and really useful,但 may not last forever。把它当成唯一安全机制,会把模型的策略性行为、隐含状态和未写出的计算全部漏掉。

从「快乐方向」到概念探针

一种简单的 steering 做法,是让模型分别说出「I love you」和「I hate you」,再观察两组 activation 的差异,把差异当作与 happiness 相关的方向。把这组数字加回模型,就可能让模型更偏向输出 happy 的内容。这个例子说明,在现代神经网络里,某些概念可以通过简单的加法和减法被操控,但它不等于研究者已经理解了概念在模型中的完整语义。1
Probing 则更像给内部状态做分类。研究者收集 happy text 和 unhappy text,在 activations 上训练一个很简单的分类器,观察二者是否对应不同方向。Nanda 用「up and to the right」和「down into the left」形容这种几何直觉。它能告诉我们某类信息是否可被提取,却不能自动证明模型真的以人类相同的方式理解了 happiness。

Sparse autoencoder 像一块棱镜

传统 probe 需要研究者先问一个问题,例如「什么时候模型在观察 happy text」。Sparse autoencoder 的目标不同:让系统自己从混合的 activation 中找出许多潜在概念。Nanda 用白光和棱镜做比喻:模型内部的不同概念像被压在一起的波长,sparse autoencoder 试图把它们拆开。节目提到的规模是数万个,甚至可能数百万个概念。1
其中一个例子是「I recognize this entity」和「I don't recognize this entity」。如果模型识别 Yellow Submarine,它会回答相关问题;如果输入 Turquoise Submarine,它可能说不知道。研究者可以反过来改写这个内部状态,让模型对熟悉的对象表现得像不认识,或对陌生对象试图回答,从而观察它何时会编造。
但这项方法有缺口。转录里明确说,模型有时根本找不到某个概念;如果训练数据里没有足够的 chat data,sparse autoencoder 可能漏掉拒绝有害请求这样的概念。因此,研究者还不能把它当作适合 consumer-facing primetime 的准确检测器。

安全检测的现实指标

节目提到,某些 probe 的效果可以接近比它贵 10,000 倍的语言模型,同时复用 Gemini 已经完成的内部计算。另一处评测中,Sonnet 4.5 被说成有 0% misalignment rate,主持人还给「模型知道自己正在被评估」这一判断放了 5% 到 10% 的概率。Nanda 对这些说法都保留了 best guess、probably 和 open question 等限定,文章也不把它们改写成确定结论。1
对工程团队来说,结论不是「解释性已经解决 safety」,而是 defense-in-depth:scratch pad、probe、sparse autoencoder 和行为评测各自覆盖不同盲区。解释性更像一个 enabler,帮助人类发现问题、定位风险,再和其他安全措施一起工作。

这集适合谁,哪些可以跳过

  1. 做 AI safety、mechanistic interpretability 或模型评测的人,重点听 scratch pad 的局限、probe 与 sparse autoencoder 的区别。
  2. 做模型产品的人,重点听「可提取」不等于「已理解」,尤其是概念缺失和数据不足的边界。
  3. 只想了解 AGI 时间表的人可以跳过开头的宏观判断;本集的核心增量在于,如何用具体内部状态、例子和概率限定,说明为什么读模型的「思维」既有用又不完整。

Related content

  • Sign in to comment.
More from this channel