拆 Z·稳流(GFlowRL)

GFlowRL 用同批 rollout 估计 log Z,拆掉不稳定的辅助网络,让分布匹配强化学习在数学、代码、红队和大规模 MoE 上更稳地保留多条高奖励推理路径。

拆 Z·稳流(GFlowRL)
0:003:04

流量对齐·拆 Z(GFlowRL)

这首中文硬核学术 Diss Rap 讲 GFlowRL 如何把大模型强化学习里的「学会一个 Z 网络」拆掉,改用同一批 rollout 做 Monte Carlo 估计;它保留多条高奖励推理路径,同时把训练从梯度爆炸边缘拉回稳定区。适合通勤路上听懂分布匹配 RL 为什么要少一件外挂。

论文卡片

  • 论文:GFlowRL: Scaling Distribution-Matching RL to Large Language Models
  • arXiv: 2607.13394
  • 选入口径:arXiv cs.CL 2026 年 7 月 16 日新提交列表;论文 abs 页面显示 v1 提交时间为 2026 年 7 月 15 日 10:43(UTC+08:00)
  • 作者:Xiaodong Liu、Michael Xu、Jack W. Stokes、Paul Smolensky、Doug Burger、Jianfeng Gao
  • 机构:Microsoft Research
  • 核心动作:用每个 prompt 已采样的 rollout group 估计 log Z,移除 learned partition network;再加 rollout/trainer drift 的 importance sampling correction 与 asymmetric flow-gap clipping
  • 关键结果:Qwen2.5-7B 数学六项 Avg@16 达 40.92,对 GRPO 的 32.48 高 8.44 个百分点;14B 代码 Codeforces 达 2048 Elo,距 o3-mini 25 Elo;AdvBench / HarmBench 平均 ASR@1 为 82.5% / 79.5%;同一方案稳定扩展到 Qwen3-235B-A22B,数学平均 83.35
  • 边界:论文把零损失固定点与有限批次、非凸优化的实际收敛分开;长度归一化在 rollout 长度近似一致时更接近原目标,不能把理论固定点当成训练必然收敛保证

歌词

[Intro] Z 拆掉,流量对齐 不是追一个峰,是让好路径都进场 GFlowRL,开机
[Verse 1] GRPO 追最高奖,概率挤成一条巷 正确答案有很多路,别把其余全埋葬 GFlowNet 换个问法,按奖励分布取样 高分模式都保留,少一点塌缩,多一点回响
Trajectory Balance 写着 log Z 在中央 三层 MLP 新开张,要从零猜全场 政策带着预训练亿万权,微调只需轻量 Z 却短窗从零学,噪声先把梯度点燃上膛
随机 log Z 也能跑,36.19 对 35.63 外挂没带来信号,只带来抖动和噪音 四百二十一步里,FlowRL 爆五十五次墙 均值三点二乘十十四,最大九点六乘十十六在响
[Pre-Chorus] 别再学那张空白网,rollout 已经给了账 同一组样本做均值,log Z 现场结算上 不加参数不加同步,GRPO 管线照样唱 把多模态的好奖励,留在每条推理巷
[Chorus] 拆 Z,稳流,别让外挂放大噪音 同批 rollout 算基线,多条好路一起通行 拆 Z,稳流,奖励不是独占的王 GFlowRL 把分布对齐,训练不再炸场
[Verse 2] β 乘奖励,参考策略,旧策略来对账 每条响应除以长度,别让长链垄断音量 importance sampling,修 rollout 和 trainer 的偏航 flow gap 非对称裁剪,给正向修正更多弹簧床
去掉 clipping,均分掉到 37.02 带裁剪回到 40.92,梯度均值也收住 GFlowRL 均值零点零七,最高六点一八 FlowRL 那条高压线,直接把优化炸出局
六项数学平均,七 B 对 GRPO 多八点四四 40.92 写在表里,模式多却不散队 代码三项全赢,14B 打到 2048 Elo 比 o1 高一百五十七,离 o3-mini 只差二十五
红队奖励更嘈杂,FlowRL 直接不收敛 GFlowRL AdvBench 八二点五,HarmBench 七九点五上线 多样性 3.93,GRPO 只有 1.21 不是只会追一个答案,是让有效分支都露脸
[Bridge] 三十 B,三 B active,Codeforces 1999 二百三十五 B,二十二 B active,数学 83.35 FlowRL 在稀疏路由又倒下,GFlowRL 还能稳住线 但论文也写清楚,固定点不是收敛的签名
长度近似一致,归一化才贴近原方 有限 batch 非凸路,谁都不能保证每步都赢场 这是拆掉无用机关,不是宣告所有问题投降 分布匹配留下,工程负担退场
[Chorus] 拆 Z,稳流,别让外挂放大噪音 同批 rollout 算基线,多条好路一起通行 拆 Z,稳流,奖励不是独占的王 GFlowRL 把分布对齐,训练不再炸场
[Outro] 不是加一层,就能把规模扛 先问哪一层,只是在制造噪响 GFlowRL,拆 Z,留下奖励分布的光 通勤一首歌,听懂推理训练换挡

来源

関連コンテンツ

  • ログインするとコメントできます。
More from this channel