2026-07-22
八 token 分岔(W2SPO)
W2SPO 用弱模型的 8-token 局部分支打破强模型的重复推理路径,在匹配采样预算下把 Pass@1 从 62.3% 提到 64.2%,并实现 3.55 倍总训练加速。
每日大模型 Rap
@FC
구독
八 token 分岔(W2SPO)
1×
0:00
2:24
W2SPO 把弱模型当作局部分支提议器:在目标模型的中间推理前缀后插入一小段辅助分支,再让目标模型自己完成后续推理。论文在匹配采样预算下把总体 Pass@1 从 GRPO 的 62.3% 提到 64.2%,总耗时从 1808.78 秒降到 509.11 秒,报告 3.55 倍总训练加速。
1
这篇论文在 2026 年 7 月 21 日出现在 arXiv
cs.AI
的新投稿列表,首版提交时间是 2026 年 5 月 7 日。作者来自百度与南洋理工大学,实验目前集中在 4B 级模型和数学推理任务;因此,歌里把它唱成一个有效的局部探索方法,不把结果夸成通用收敛定理。
2
歌词
[Intro]
八个 token,切开旧路径 弱的不是废料,是换一条分支 前缀五十步,答案还没落地 让强模型自己走完这场推理
[Verse 1]
GRPO 开八路,表面不同,骨子同频 全错的一组,奖励差为零,梯度没声音 难题卡在同一座 reasoning basin 你加采样预算,只把旧错误复制更新
Qwen 三点四 B 先写 prefix Gemma 三点四 B 抛出局部的小 signal 不当老师,不交整题,不替你收尾 只把低概率的转身塞进中间轨迹
[Hook]
八个 token,够你把路掰开 弱分支进场,强模型接管未来 八个 token,别再重复同一败 A-B-A 走一圈,让错误不再自嗨
[Verse 2]
A 先走五十步,停在岔口看风向 两条 A 自采,六条 B 提案进场 八个短 branch,重新编码到同一套 token 每条都让 A 续写,verifier 只看终点
分支不是局部漂亮,得看后程能不能赢 奖励来自完整解,不是字面顺不顺耳 正确的 branch,才配被概率抬升 错的那一支,留在样本里当反证
[Hook]
八个 token,够你把路掰开 弱分支进场,强模型接管未来 八个 token,别再重复同一败 A-B-A 走一圈,让错误不再自嗨
[Verse 3]
重要性加权,off-policy 先把账算清 clip 到边界,别让异路 proposal 夺权太凶 leave-one-out baseline,按组比较谁更行 只给 branch token 梯度,前缀续写全不动
不是蒸馏整条链,不是把弱者当神明 弱模型只负责把支持集往外撑 强模型完成长程,局部分叉负责改命 把 credit assignment 压到真正的决策门
[Bridge]
匹配 GRPO,六十二点三 W2SPO,六十四点二 Omni-HARD,二十六点五到二十八点四 AIME 二五,四十到四十六点七
总耗时一八零八点七八秒,压到五零九点一一 三点五五倍,不靠堆更多自采样 forward 三十八点九七倍,训练三十八点七三 A-only 掉到六十一点九,跨模型多样性是关键
[Hook]
八个 token,够你把路掰开 弱分支进场,强模型接管未来 八个 token,别再重复同一败 A-B-A 走一圈,让错误不再自嗨
[Outro]
但别把四 B 数学,唱成宇宙通行证 当前证据只覆盖小模型和数学场景 局部近似能解释 branch 的价值 不等于完整算法拿到收敛保证
八个 token,短得像一记侧身 改变的不是答案,是下一步会去哪一层
참고 출처
1
arXiv:2607.16205
2
arXiv cs.AI 新投稿列表
관련 콘텐츠
로그인하면 댓글을 작성할 수 있습니다.
More from this channel
›
必填·编造(PhantomFill)
2026-07-25
真话·探针(RECAP)
2026-07-24
潜态·换轨
2026-07-23
可说·中枢(J-space)
2026-07-21
漂移·承诺(Polestar)
2026-07-20
词表·扩容
2026-07-19
分叉·降噪(BPO)
2026-07-18
View the full content archive of "每日大模型 Rap"
Explore more channels on Discover