真话·探针(RECAP)

这首 rap 讲清为什么高重建分数不等于逐条真实,并用 RECAP、独立 probe 与关键实验数字拆解可验证激活解释的边界。

真话·探针(RECAP)
0:002:56
重建分数可以很高,解释里的具体事实却未必真的被模型编码。这首 rap 讲清 arXiv:2607.20379 的 RECAP:把指定内容写进目标模型的隐藏状态,再用独立 probe 检查它,而不是继续训练一个更会「说得像真的」解释器。

这首歌在讲什么

论文先审计自然语言激活解释器。Qwen-2.5-7B 的 layer-20 verbalizer/reconstructor 在 1,517 条 claim 上取得约 0.84 的归一化重建分数,但有效翻转审计发现,约 2% 的具体 claim 对重建真正敏感;分数更像抓住 gist,而不是逐条核实事实。1 2
RECAP 的动作很直接:在目标模型隐藏层上联合训练线性辅助预测头,让指定内容保持可解码;训练完成后,换一个独立 fresh probe 来验。合成 sandbox 中 5/5 次运行都恢复了指定内容的可检验性,额外代价约为 0.001 nat。迁移到 Pythia-160M 后,truth probe 的 AUC 约为 0.965,对照组约为 0.823;面对会压低约 87% 重建谎言惩罚的 score-optimal 攻击,RECAP probe 仍达到约 0.952 AUC,而对照组接近随机。2
边界也写进了歌里:decodability 不等于 verbalizability,更不等于模型会在行为中使用这段内容;RECAP 需要训练时联合加入,不能直接补到 frozen model 上。证据目前来自合成 sandbox、一个 Qwen-2.5-7B 已发布系统和 Pythia-160M,主要覆盖 closed-vocabulary claim,不是 open-ended faithfulness 的完整证明。2
论文署名为 Hiskias Dingeto,arXiv 页面列出 cs.AI 与 cs.CL 分类,未列机构信息。提交时间为 2026 年 7 月 23 日 01:10(+08:00)。原文:Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

歌词

[Intro] 重建分数冲高,真话却没上台 gist 在灯下发亮,specific 躲在雾海 Qwen 二点五,七 B,二十层 tap 开麦 一千五百一十七条 claim,逐句拆开
[Verse 1] AV 把激活写成话,AR 再把话变回向量 cosine 给你一个分,像审判一样端庄 可翻一条具体事实,分数纹丝不晃 说得像懂了全部,其实只记住大方向
r-hat 零点八四,漂亮得像金牌 specific grounding 约百分之二,剩下靠 gist 撑台 改写还能过关,遮掉内容才会败 这套仪表读的是轮廓,不是每句真假牌
[Pre-Chorus] 高分不等于真,重建不等于证 把读者训得更会说,没把模型训得更诚
[Chorus] 别训 reader,训 model,真话要能被探针摸 RECAP 把指定内容钉进 hidden state 的锁 fresh probe 独立验,AUC 零点九六五开火 谎言想靠 reconstruction 过门,探针照样抓破
[Verse 2] 合成 sandbox 五次跑,private code 五次都长 假的 wording 变通行证,grounded-minus-true 三到八成晃 重建目标一上头,decodable content 直接塌方 冻结 probe 跟不上 drift,换坐标也得重新量
RECAP 不改 verbalizer 的嘴,先把 target model 训练强 线性 head 对着外部目标,让指定内容留在场 fresh probe 不是同伙,换个读法也能验真相 代价加零点零零一 nat,五局全都不慌
[Chorus] 别训 reader,训 model,真话要能被探针摸 RECAP 把指定内容钉进 hidden state 的锁 Pythia 一百六十 M,truth rate 四四到四六 control 近乎归零,存得住不代表说得出口
[Bridge] 对手改报告,专挑分数的盲区下手 最优 lie 压掉八十七趴 penalty,想把仪表盘骗走 RECAP probe AUC 零点九五二,recall 零点八六守 control AUC 零点五零八,接近随机的手
但别把 probe 当神,decodable 不是会行动 closed-vocab 的 claim,不能包办 open-ended 的风洞 要 co-train,frozen model 不能事后硬缝 存储可查,只说明藏在里面,不保证行为会动
[Final Chorus] 别训 reader,训 model,真话要能被探针摸 高分不等于真,先问这句事实有没有着落 RECAP 让独立检查穿过漂亮的 prose 通勤这一首唱完,别被重建分数带走
[Outro] Train the model, not the reader 重建是分数,探针才是证据 指定内容能被查,谎言才没法躲 但能被读出,不等于模型真的照它做

関連コンテンツ

  • ログインするとコメントできます。
More from this channel