零方差·引路(LEEPS)
0:003:14
LEEPS 用潜态近邻引导 explore–exploit prompt 采样,减少 RLVR 中零方差 rollout 的无效算力,同时保留探索覆盖。

[Intro]
七月三十一,cs.CL 新榜
论文七月三十,提交时间别唱成榜
一组 rollout,全对全错同一张
奖励没有起伏,advantage 归零一场
[Verse 1]
RLVR 想让模型学会想
可 prompt 一进组,八次答案同样
全对没有梯度,全错也没方向
算力烧在原地,信号却不响
不是模型不肯跑,是题目没分量
先筛掉零方差,才让每次采样有光
旧法要么只盯熟客,把覆盖面锁上
要么撒网太宽,informative ratio 先投降
[Chorus]
零方差,整组没信号
先问谁值得跑,别让全池一起烧
探索利用,两条路都要
LEEPS 把 rollout 预算,压到会变化的跑道
零方差,整组没信号
中等难度才有梯度,别只追简单的高
历史给你地图,潜态替你探哨
不加 selection rollout,也能把废步数砍掉
[Verse 2]
Exploit portfolio,成功率别冲到顶
a 乘一减 a,中间难度才会醒
Explore portfolio,陌生题别直接清零
hidden state 找近邻,借历史估它的命
两套组合动态配,目标 tau 九成
non-trivial ratio 近了,预算才算稳
候选池十六倍,八次 rollout 入阵
K 六十四邻居,按相似度找新声
冷启动五步,探索比例留余温
不额外再跑筛选,先用已有回声问
[Verse 3]
Qwen Math 一点五 B,七 B 同台开盘
DAPO-Math-17K,八次采样验算
六个数学 benchmark,平均三九点一六
对最强 DPS 加零点九九,二点六的相对增益
七 B 平均四七点五三,火力再上翻
对 DPS 加一点七,三点七相对站
OOD 三项平均,二八点零八与四零点九五
不是只在训练集赢,外域也留下一点痕
在线选择两秒多,二点一五、二点二六
拿选择换信号,没把主循环拖垮线
[Bridge]
随机探索,一点五 B 三七点五一
均匀利用,三八点四八还差一线
去掉组合,三七点九四回到原点
LEEPS 三九点一六,四路消融把机制点燃
七 B 随机四五点八六,均匀四六点二九
去掉 portfolio 四五点二七,完整四七点五三
不是 latent 单打,也不是 exploit 独演
两条腿一起走,才把覆盖和信号接联
[Verse 4]
但别把这首唱成免费午餐的宣言
全量 prompt 表征,离线先做一遍
邻居缓存 O N 平方 d,存储也要钱
一点五 B 用二十二层,七 B 二十六层选
目标 tau 九成,探索比例还得调参
数学 RLVR 是主场,外域证据不算宽
Qwen2.5-Math 的胜利,不能替所有模型代言
减少废 rollout 很硬,但不是泛化保证签
[Final Chorus]
零方差,整组没信号
先问谁值得跑,别让全池一起烧
探索利用,两条路都要
LEEPS 把 rollout 预算,压到会变化的跑道
零方差,整组没信号
三九点一六,四七点五三记牢
不是多生成答案,是先挑会发声的招
通勤听完这一首:算力要给有方差的刀
[Outro]
全对全错,不等于学得好
先找会分叉的题,再让模型把路跑
潜态只是导航,缓存不是无穷宝
LEEPS 留下的狠话:采样之前,先把信号找