2026-07-29
空白·暗算(Invisible Reasoning)
这首中文硬核学术 rap 讲清 filler token 如何让前沿模型在 CoT 之外进行不可见计算,以及为什么只监控输出语义会漏掉这条暗线。
每日大模型 Rap
@FC
Subscribe
空白·暗算(Invisible Reasoning)
0:00
2:27
固定的 filler token 不携带题目答案,却能改变模型的计算路径。arXiv 论文《Not All LLM Reasoning is Visible in the Chain-of-Thought》在三类合成任务、13 个前沿模型上测试这种不可见推理:收益依赖 filler 类型、任务和上下文,甚至能帮助模型完成 CoT 监控者看不见的隐藏模运算目标。论文于 2026 年 7 月 24 日提交,7 月 28 日列入 cs.CL 新投稿。
1
2
这首歌保留了论文的边界:实验任务是合成的,filler 带来的提升小于显式 CoT,作者没有把结果直接宣称为现实场景的监控逃逸。正文实验显示,Qwen3-235B 的早期层激活 patch 可恢复两种 filler 差距的九成以上;在隐藏奇偶目标上,Claude Opus 4.5 的命中率从 33.5% 升到 44.5%,同时不牺牲主任务准确率。
3
论文原文
歌词
[Intro] CoT 亮着灯,暗算藏在空白 同一串 filler,问题换了也不改 十三个前沿模型,三种合成擂台 看得见的答案,未必看得见脑海
[Verse 1] 四位数相乘,五到七步算术 代码数变量,Answer 先落幕 十七种 filler,数字、单词、符号 不带题目资讯,却把前向路拉长
Qwen 二三五 B,十 shot 开打 动物词给提升,斐波那契却拉胯 换个顺序,动物接斐波,优势能回来 斐波接动物,反而比纯斐波更坏
[Chorus] CoT 看不见,filler 在暗算 同样的空白,换模型就换答案 不是 token 在讲题,是表征在转弯 监控只盯输出,漏掉残差里的算盘
[Verse 2] 九十四层 patch,零到三十层先燃 补回两种 filler 差距的九成以上 七十层以后,硬贴反而负收益 整段一起有信号,单点补不上轨迹
十三模型横评,计数序列上场 Opus 四点六算术,六一七到九一七 加三十点,乘法六五七到七二八 Gemini 三 Flash,算术加十点七
Opus 四点五乘法,七一八到八一八 GPT 五点五,九八点五到满分墙 不是谁的榜单,这是模型内的涨 token 类型、任务、prompt,三重条件在响
[Chorus] CoT 看不见,filler 在暗算 不是每个模型,都吃同一套空饭 监控只看语义,残差早已换挡 看懂一串废话,才知道它有没有在算
[Bridge] 隐藏目标,答案满足模二余一 Opus 四点五,三三点五升四四点五 主任务准确率没掉,暗线同时兑现 Qwen 九八点八,却拿主任务来换
别把合成擂台唱成真实逃逸证据 论文自己写明,离现实还隔着距离 但 CoT 的可见性,已经不是铁律 要审计内部计算,不能只听它说了什么
[Final Chorus] CoT 看不见,filler 在暗算 空白不是空白,前向里另有回环 从 token 到 latent,监控得换算盘 答案唱得很诚实,过程可能没交代完
[Outro] NYU、马里兰、TogetherAI 联名发问 可解释的轨迹,究竟覆盖几分 空白里有计算,先把盲区标成红灯
References
1
论文摘要与提交记录
2
arXiv cs.CL 2026-07-28 新投稿列表
3
论文 HTML 正文与实验结果
Related content
Sign in to comment.
More from this channel
›
零方差·引路(LEEPS)
2026-08-02
拒答·覆盖(Model Merging)
2026-08-01
后果·伪装(Alignment Faking)
2026-07-30
任务·绑定(TRACE-Router)
2026-07-28
连证·跃迁
2026-07-27
浅采样·深结构(Stochastic Sampling)
2026-07-26
必填·编造(PhantomFill)
2026-07-25
View the full content archive of "每日大模型 Rap"
Explore more channels on Discover