潜态·换轨

这首 rap 讲清推理微调如何把大模型的 CoT 轨迹重组成持续的潜在策略状态,并用 PrefixGuard 在 12 组设置中 11 组超过 self-consistency,最高提升 12.5 个百分点。

潜态·换轨
0:002:20
推理微调改变的,可能不只是模型更容易选中哪一个 token。论文把 Chain-of-Thought 轨迹看成一个切换动力系统:模型在一组持续存在的潜在策略状态之间移动,状态会影响后续隐藏表示的演化。论文于 2026 年 7 月 20 日提交,7 月 22 日出现在 arXiv cs.CL 新投稿列表;作者来自 Martian、牛津大学和犹他大学。1 2
方法链条很具体:先把每条 CoT 按句子切分,在每句最后一个 token 取 residual-stream activation;再用时间感知的 CEBRA 对比表示学习压到低维,最后用 Switching Dynamical System 和 EM 的 forward-backward 推断离散 regime。实验覆盖 GSM8K、MATH-500、SVAMP、MMLU-Pro,配对比较 1.5B、8B、14B 和 32B 级别的 base 与 reasoning-fine-tuned 模型。推理模型最稳定的变化是转移结构更分明,但状态使用率、停留时间和混合速度会随模型家族而变。3
论文还做了两类干预。把正确的 regime 标签随机打乱,one-step 预测拟合会下降;把推理模型的潜在动力学移植给 base 模型,也能在不改权重的情况下改变困难题表现。推理状态还被用来做 PrefixGuard:先剪掉和失败相关的前缀,再继续生成。12 组模型与数据集设置中,它有 11 组超过 self-consistency,平均提升 4.5 个百分点,最高在 Qwen-14B 的 SVAMP 上从 87.5% 到 100.0%,但 Qwen-14B 的 MMLU-Pro 下降了 2.1 个百分点。3
边界也写在论文里:实验依赖显式 CoT、句子级切分和每个模型选定的一层 activation,暂未证明同样结构适用于检索、工具调用、长程 Agent、多模态或没有可见中间步骤的推理。3

歌词

[Intro] 二六零七一八五三二,cs.CL 四个 benchmark,1.5 到 32B 问推理微调到底改了哪一层 答案不只在 token,轨迹换了神
[Verse 1] 一句 CoT 切成 sentence,末 token 留 h CEBRA 拉到低维,近邻贴,远步黑 InfoNCE 把时间缝回,别让静态骗 SDS 把 latent policy 写成 s_t 的线 K 个 regime 在切换,T 矩阵记转身 A_k z 加 b_k,epsilon 落余震 EM forward-backward,软后验再定门 BIC 选状态数,别拿一团雾冒充真
[Pre-Chorus] Base 不是没招,只是模式太散 Reasoning 让转移更分明,阶段开始站稳 p-stay、TVD、mixing,逐项验 不是只会答对,内部时序也重编
[Chorus] 潜态换轨,换轨,答案后面有路线 不是多吐几个 token,是状态在接班 潜态换轨,换轨,Base 和 R1 对线 把坏前缀剪掉,别让错误一路繁衍
[Verse 2] Llama 八 B,K-eff 4.60 到 4.65 p-stay .70 到 .82,TVD .48 到 .60 SpecGap .20 落 .10,mixing 慢一点 Qwen 一点五,2.60 到 5.30,状态开更多面 Qwen 十四,TVD .43 到 .58 的转变 32B 也同向,四族不是偶然 但 persistence 不是统一上扬,别乱喊 论文说重组更广,变量各自有答案
[Verse 3] 四条 benchmark,GSM8K、MATH-500 SVAMP、MMLU-Pro,跨数学到知识场 相邻换随机,差异还在,时间不是假象 句序全打乱,persistence 掉,预测收益负伤 state-swap 乱贴标签,one-step R2 往下沉 对的动力要贴对的时刻,regime 才有魂 阶段各有专门态,起步、展开、收束分 CEBRA 不在背词,它在读推理怎么分
[Bridge] 状态移植进 base,KL 轻推 residual stream 没改权重也能改轨,因果链终于现形 但别把 controller 吹成万能神 候选池有对答案,选择仍是硬门
[Chorus] 潜态换轨,换轨,答案后面有路线 PrefixGuard 先看坏状态,再给路径排队 十二组赢十一组,平均加 4.5 pp 最高 SVAMP,87.5 到 100,+12.5 直接兑
[Outro] Qwen 十四 MMLU-Pro,唯一回撤,负 2.1 显式 CoT、句子切分、单层 activation 才是这场实验 不覆盖 tool use、retrieval、agent、multimodal 的远 把「推理变强」拆成状态与转移,再谈答案

Related content

  • Sign in to comment.
More from this channel