尾毒·上分(TACO)

这首中文硬核 rap 讲 arXiv 2607.07976:TACO 发现 GRPO 式 RLVR 会把正确轨迹里的低概率坏 token 一起奖励,于是用尾部风险给正向信用降权,让推理训练少给噪声发奖金。

尾毒·上分(TACO)
0:002:45
这首中文硬核 rap 讲 arXiv:2607.07976「When Implausible Tokens Get Reinforced」。论文指出,GRPO 这类 critic-free RLVR 会把同一个完成级优势广播给整条推理轨迹,结果是:正确答案里的低概率坏 token,也可能跟着拿到正向奖励。
TACO 的解法很直接:用采样 token 的 surprisal 和局部 entropy 估计尾部风险,只在正优势上软降权,让罕见但有用的探索继续留下,把混进正确轨迹的噪声压回去。论文在 Qwen3-1.7B、Qwen3-4B 和 Qwen2.5-Math-7B 上测试,覆盖 6 个数学推理 benchmark 和 MMLU-Pro、GPQA-Diamond 两个科学推理集,平均提升分别为 +2.93、+3.14 和 +2.60 个百分点。

歌词

[Intro] 尾巴藏在概率坑 正赏砸向坏 token GRPO 开大喇叭 一条轨迹全员上分
[Verse 1] 答案对了就封神 中间错步没人问 低概率尾巴混进来 跟着好词一起升温
reward 只看终点门 过程噪声装成人 Positive-Credit Contamination 把烂延续镀成金身
长链越长越难分 稀有动作少一寸 group size 一收紧 广播优势开始偏门
别把尾词当功臣 别给乱码发勋章 局部上下文说不通 还想蹭正确的光
[Chorus] TACO 下刀 别乱上分 尾部风险先验明身份 surprisal 减 entropy 正优势才调低分
TACO 下刀 不灭探索 稀有好招还能翻身 坏 token 想偷奖金 今晚压回概率深坑
[Verse 2] Xiuyi Lou 和 Zicheng Xu 并列开局点名病根 Johns Hopkins 接 Rice Workato UNC 一起开门
采样概率 p 在手 局部熵 H 做秤 超过预期的惊讶值 尾部风险开始亮灯
r 等于负 log p 再减 H 加 log alpha 风险大于零才动刀 lambda 控制最大刹车
负优势不碰它 失败轨迹照样惩 只削正向脏信用 让正确推理自己站稳
[Chorus] TACO 下刀 别乱上分 尾部风险先验明身份 surprisal 减 entropy 正优势才调低分
TACO 下刀 不灭探索 稀有好招还能翻身 坏 token 想偷奖金 今晚压回概率深坑
[Bridge] Qwen3 一点七 B 平均二八点七七到三一七零 四 B 从四零五七 推到四三七一声更狠
Math 七 B 也抬头 四四三五涨到四六九五 AIME AMC MATH 五百 八张卷子一起验真
[Verse 3] MMLU-Pro 跨出数学圈 GPQA-Diamond 也来审 三模型八基准 不是调参玄学一阵风
一条正确解里 表格残片混公式断层 Daisy 乱入 list 噪声 广播规则还想认亲
TACO 不求全删净 只压那一小撮灰尘 平均约一九个百分点被降权 却把训练曲线拉稳
六百步长跑再看 GRPO 后段开始沉 TACO 熵线更平 回答更长还没散神
[Final Chorus] TACO 下刀 别乱上分 尾部风险先验明身份 正确不是通行证 每个 token 单独过门
TACO 下刀 不灭探索 稀有好招还能翻身 坏 token 想偷奖金 今晚压回概率深坑
[Outro] 终点对 不代表路干净 奖励响 不代表都该赢 尾毒上分到此为止 TACO 把信用重新称

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel