晚塌·定案(DEGS)

这首中文硬核 rap 讲 DEGS 如何用层间熵的「晚塌」信号,在无需训练、奖励模型或标注数据的情况下,把大模型推理候选重新排出更高的跨域准确率。

晚塌·定案(DEGS)
0:002:45
DEGS 把大模型每层的熵变化拿来做测试时筛选:正确候选往往不是更早自信,而是让不确定性留到更深层,再用 p(x)^α exp(βD(x)) 把这些候选送进 MCMC 反复重排。论文在三个开源模型、四个推理基准上验证了这条路线,DEGS-MCMC 在 12 个对照格里全部超过只看似然的 power sampling,11 格成为最强训练免推理解码器;额外墙钟开销为个位数百分比。
选题口径:arXiv 的 cs.LG 2026 年 7 月 14 日 new listing 收录了这篇论文;其 abs 页面显示 v1 提交日期为 2026 年 6 月 19 日。本期采用 new listing 作为「最新论文」口径,并保留 abs 页提交日期差异。
来源:

歌词

[Intro] 晚塌,晚塌,别急着亮牌 七层探针扎进每一层的海 D-E-G-S,测试时开麦 不加训练,照样把答案筛出来
[Verse 1] 普通 likelihood 只看最后一拍 DEGS 盯住 hidden state 怎么改 强 reasoner 不会太早把结论盖 熵留在深层,直到更后才定案 Qwen Math 七 B,base 十层已跌到二点五 nats RL 变体十五到二十层,还在五以上晃 早承诺,像把错答案先焊 晚塌,不等于犹豫,是给推理留缓冲带
[Hook] 晚一点塌,才有机会答对 先别把置信度写死在浅层的嘴 p 的 alpha 次,乘 exp beta D 把外层分数和内层犹豫一起配 晚一点塌,才有机会穿越 训练不用开,reward 不用借 一条弱信号,单看只像擦边 进 MCMC 循环,反复重排才上分线
[Verse 2] 每个 token 找最早过阈值的 layer tau 零点二五 nats,四到二十八取七阶 d t 除总层数,再对整条序列求平均 这就是 D,深度不是装饰,是筛选器的电 alpha 等于四,beta 等于五,目标写在盘面 似然保整体,深度给近邻候选补一箭 单点 AUC 只有零点六,别把它吹成神谕 MATH 五百,低桶零点一七,高桶零点四一 DeepMind 五百,高桶约是低桶二点六倍 弱信号进轨迹,才把差别一寸寸堆
[Verse 3] DEGS-MCMC,十步一轮,把 tiebreak 反复锤 十二格全涨,十一格训练免法站在榜头位 Qwen 二点五七 B,MATH 五百七二点八 DeepMind 五七三,HumanEval 七六点九,GPQA 三九点三 Math 七 B,七六点七、六一九、六一八、四二六 三模型 GPQA 都压过 GRPO 的域外牌 三九点三对三五点四,四二点六对三九点九 DeepSeek 三九点二对三三点三,跨域才见谁 不是凭空长新能,是把 base 里的好样本重新配
[Bridge] 探针只看七层,别把算力浪费成烟 MCMC 额外墙钟约加八点八,单数位的价钱 但它要开源权重,黑盒 API 没这条线 数学和科学先过关,开放事实还等下一篇
[Outro] 模型不是每一步都在同一层下判 有的答案浅层就锁,有的答案深处才转弯 晚塌·定案,DEGS 把犹豫变成证据 你听见的不是更长思考,是更晚落锤

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel