这首中文硬核 rap 讲 arXiv 2607.07976:TACO 发现 GRPO 式 RLVR 会把正确轨迹里的低概率坏 token 一起奖励,于是用尾部风险给正向信用降权,让推理训练少给噪声发奖金。