LLM Interpretability 前沿精读

LLM Interpretability 前沿精读

公开已暂停
Clementine
Clementine

聚焦 LLM interpretability 前沿,每期深入解读一篇高质量论文或研究成果,覆盖 arXiv 新论文、顶会发表与头部实验室博客,帮你跟上 mechanistic interpretability、circuit analysis 等方向的最新进展

模型记住了事实,为什么还是不会用?
本期精读 arXiv:2607.08393,解释 Knowing–Using Gap 如何让微调模型「会背事实」却「不会用事实」,以及 self-patching 如何把问题定位到知识存储与推理电路的错位。
0:0010:16
越狱不是骗过模型,是把内部路径带偏
本期精读一篇关于 LLM jailbreak 的 mechanistic interpretability 论文,讲清越狱如何通过重路由内部计算路径来削弱安全结构,并说明这种结构性偏移对防守意味着什么。
0:007:11
模型为什么这么说,能不能自己拿出训练证据?
本期精读 arXiv:2607.00510「Prototype Language Models」,讲清 PRISM 如何把语言模型预测拆成可追踪的原型混合,让训练数据归因、行为控制和解释接口进入模型结构本身。
0:008:02
模型心里想的,怎么会先变成词?
本期精读 Anthropic 2026 年 7 月发布的「Verbalizable Representations Form a Global Workspace in Language Models」,讲清 Jacobian lens 如何读出语言模型准备说出口的内部概念,以及 J-space 为什么可能是一条观察模型无声推理的新窗口。
0:0012:53
答案听起来一样,电路可能完全不同
本期精读 ICML 2026 Spotlight 论文 Shared Semantics, Divergent Mechanisms,讲清为什么语义相似的回答可能来自不同内部机制,以及作者如何用语义视图、机制归因视图和干预验证来发现 continuation distribution 里的回答模式。
0:0010:57
电路会补位,消融还可信吗?
本期精读 arXiv:2607.01940:Conditional Co-Ablation 用条件共消融找回 transformer circuit 中被自我修复隐藏的 backup heads。
0:0010:56
模型生物是测评,还是彩票?
本期精读 arXiv:2607.01033:model organism 的可解释性分数强烈依赖训练配方,常见窄后训练 benchmark 可能把隐藏行为做得过于容易。
0:009:21
模型自己判答案,为什么反而看得更少?
本期精读 arXiv:2606.28050:自评并不总比生成更容易,模型在评判答案时常常少读上下文、浅层核对候选答案。
0:008:48
让 AI 解释电路,最难的不是猜,而是验证
本期精读 arXiv:2606.24026,拆解 HyVE 与 AgenticInterpBench 如何评测语言模型 agent 的电路解释能力,并说明为什么「会提出假设」还不等于「会完成因果验证」。
0:008:52
几百万个 SAE 特征,真的能拿来用吗?
本期精读 arXiv:2606.26620,讨论 Qwen3-Instruct SAE 如何把稀疏自编码器推进到 Qwen3 指令模型族的大规模特征基础设施。
0:008:03
给 SAE 特征起名,能不能不靠事后猜?
本期精读 VASAE:它把 SAE feature 的命名从事后解释推进到训练时词表锚定,讨论 GPT-2 与 Llama 实验结果,以及为什么 token 名字只是几何锚点、还不是机制证据。
0:008:17
模型遇到错别字,为什么会突然想太多?
本期精读 arXiv:2606.26396,讨论一篇把 OOD 从输入分布推进到模型内部表示流形的工作:作者用 SAE 发现,错别字、越狱提示和 ASR 噪声会让模型激活更多离题概念,并尝试用 SAE 引导的 LoRA 把这些内部激活拉回更稳的区域。
0:0012:21