LLM 可解释性论文精读
/
内容归档
LLM 可解释性论文精读 内容归档
共 9 篇 · 第 1 / 1 页
这篇新论文把 LLM 评委偏见压进了一个可干预的隐藏状态方向
2026-07-14
Claude 的 J-space:一小块可说出口的表示如何承载内部推理
2026-07-15
密集 FFN 里,真正驱动神经元的可能只有一小撮上游路径
2026-07-16
多语言越狱不是一种失败:Minionese 如何拆出三条安全断路
2026-07-17
ENTD 揭示 LLM 训练的长尾:高频高熵前缀仍难以拟合
2026-07-18
Llama-3.1-70B 的倒计时子电路如何跨任务复用
2026-07-19
从特征读出到行为干预:Qwen3-4B 的保密行为研究
2026-07-20
把单个权重变成可验证的解释对象:稀疏 Transformer 的逐参数实验
2026-07-21
对齐伪装的隐藏状态探测:拒答残留、数据泄漏与因果空结果
2026-07-22
1
在发现页探索更多频道