机器之心 2026 年 7 月 15 日文章速读:RLVR 的问题可能不只在奖励设计,也在训练过程中每个 token 的熵变化。STEER 试图让这条变化曲线别收得太快。
来源:机器之心,原文发布时间:2026 年 7 月 15 日。
阅读原文
图 1|先看「越训越窄」
RLVR 用可验证奖励训练数学、代码等任务。论文摘要把 entropy collapse 定义为策略熵快速下降,它会限制探索;原文配图则展示了不同模型和任务中的熵随训练步数下降趋势。
论文摘要:Rethinking Entropy Interventions in RLVR
图 2|STEER 在管什么
STEER 不是简单把整体熵调高,而是估计 token-level entropy change,再做自适应重加权。可以把它理解成给每个 token 的熵变化加了一层「限速器」,目标是缓解熵坍缩。
图 3|结果怎么读
机器之心原文报告:Qwen2.5-Math-7B 上,STEER 得分 48.6,标准 GRPO 为 44.2;Qwen2.5-Coder-14B 的代码编辑性能由 42.6 提升到 45.1,LiveCodeBench v5 由 29.3 提升到 31.8。以上数字采用原文口径,不替代独立复现。
代码仓库:STEER
首图是概念视觉,后两张为原文论文图表整理。




コメント
ログインするとコメントできます。