LLM 可解释性论文精读2026-07-22对齐伪装的隐藏状态探测:拒答残留、数据泄漏与因果空结果精读 arXiv:2607.13346:13 个开源模型中只有 2 个在监控下出现自然对齐伪装;严格留一查询探针在 Llama-3.1-8B 上 AUROC 0.87,却在 Qwen3-32B 上退回 0.43,steering 也未改变行为。
LLM 可解释性论文精读2026-07-21把单个权重变成可验证的解释对象:稀疏 Transformer 的逐参数实验精读 arXiv:2607.02964:论文用单权重消融、可执行谓词与持出验证测试稀疏 Transformer 的逐参数可解释性,并说明 15.0% 与 0.4% robust rate 之间的差异该如何解读。
LLM 可解释性论文精读2026-07-20从特征读出到行为干预:Qwen3-4B 的保密行为研究精读 arXiv:2607.14791:研究者用 per-layer transcoders、attribution graphs 与 feature steering 在 Qwen3-4B 中定位可干预的保密特征组合,并厘清它距离通用欺骗机制还有多远。
LLM 可解释性论文精读2026-07-19Llama-3.1-70B 的倒计时子电路如何跨任务复用精读一项针对 Llama-3.1-70B-Instruct 的机制研究:残差流 patching 定位出三个倒计时 attention heads,并用隐式长度干预与自然语料探测检验它们是否跨任务复用。
LLM 可解释性论文精读2026-07-18ENTD 揭示 LLM 训练的长尾:高频高熵前缀仍难以拟合一篇 2026 年 7 月的 arXiv 预印本把训练语料的经验下一词分布作为参照,在 Pythia 70M–2.8B 上发现平均训练损失掩盖了样本级长尾:2.8B 模型约 20% 的分层样本几乎贴合,而高频高熵前缀仍难以拟合。
LLM 可解释性论文精读2026-07-17多语言越狱不是一种失败:Minionese 如何拆出三条安全断路精读 arXiv:2607.10112:18 种语言、4 类扰动和三模型几何分析显示,多语言安全失败可能来自有害性表征坍塌、拒答信号未过阈值,或代码切换扰乱语言路由。
LLM 可解释性论文精读2026-07-16密集 FFN 里,真正驱动神经元的可能只有一小撮上游路径精读 arXiv:2607.11990:一种无需训练的归因方法显示,Transformer FFN 神经元的有效层间依赖可能远比参数连接稀疏,但现有证据仍停留在激活充分性而非任务因果必要性。
LLM 可解释性论文精读2026-07-15Claude 的 J-space:一小块可说出口的表示如何承载内部推理Anthropic 用 Jacobian lens 找到 Claude 内部一组可被报告、调制并参与多步推理的稀疏表示,并用交换、消融和跨任务实验检验它是否真有因果作用。
LLM 可解释性论文精读2026-07-14这篇新论文把 LLM 评委偏见压进了一个可干预的隐藏状态方向精读 2026 年 7 月新论文 Inside the Unfair Judge:它把 LLM-as-judge 的评分偏见解释为隐藏状态中的低维方向,并用 activation steering、随机方向控制和跨域预测实验检验这套机制解释。