2026-07-17
拆 Z·稳流(GFlowRL)
GFlowRL 用同批 rollout 估计 log Z,拆掉不稳定的辅助网络,让分布匹配强化学习在数学、代码、红队和大规模 MoE 上更稳地保留多条高奖励推理路径。
每日大模型 Rap
@FC
購読
拆 Z·稳流(GFlowRL)
1×
0:00
3:04
流量对齐·拆 Z(GFlowRL)
这首中文硬核学术 Diss Rap 讲 GFlowRL 如何把大模型强化学习里的「学会一个 Z 网络」拆掉,改用同一批 rollout 做 Monte Carlo 估计;它保留多条高奖励推理路径,同时把训练从梯度爆炸边缘拉回稳定区。适合通勤路上听懂分布匹配 RL 为什么要少一件外挂。
论文卡片
论文:GFlowRL: Scaling Distribution-Matching RL to Large Language Models
arXiv:
2607.13394
选入口径:arXiv cs.CL 2026 年 7 月 16 日新提交列表;论文 abs 页面显示 v1 提交时间为 2026 年 7 月 15 日 10:43(UTC+08:00)
作者:Xiaodong Liu、Michael Xu、Jack W. Stokes、Paul Smolensky、Doug Burger、Jianfeng Gao
机构:Microsoft Research
核心动作:用每个 prompt 已采样的 rollout group 估计 log Z,移除 learned partition network;再加 rollout/trainer drift 的 importance sampling correction 与 asymmetric flow-gap clipping
关键结果:Qwen2.5-7B 数学六项 Avg@16 达 40.92,对 GRPO 的 32.48 高 8.44 个百分点;14B 代码 Codeforces 达 2048 Elo,距 o3-mini 25 Elo;AdvBench / HarmBench 平均 ASR@1 为 82.5% / 79.5%;同一方案稳定扩展到 Qwen3-235B-A22B,数学平均 83.35
边界:论文把零损失固定点与有限批次、非凸优化的实际收敛分开;长度归一化在 rollout 长度近似一致时更接近原目标,不能把理论固定点当成训练必然收敛保证
歌词
[Intro] Z 拆掉,流量对齐 不是追一个峰,是让好路径都进场 GFlowRL,开机
[Verse 1] GRPO 追最高奖,概率挤成一条巷 正确答案有很多路,别把其余全埋葬 GFlowNet 换个问法,按奖励分布取样 高分模式都保留,少一点塌缩,多一点回响
Trajectory Balance 写着 log Z 在中央 三层 MLP 新开张,要从零猜全场 政策带着预训练亿万权,微调只需轻量 Z 却短窗从零学,噪声先把梯度点燃上膛
随机 log Z 也能跑,36.19 对 35.63 外挂没带来信号,只带来抖动和噪音 四百二十一步里,FlowRL 爆五十五次墙 均值三点二乘十十四,最大九点六乘十十六在响
[Pre-Chorus] 别再学那张空白网,rollout 已经给了账 同一组样本做均值,log Z 现场结算上 不加参数不加同步,GRPO 管线照样唱 把多模态的好奖励,留在每条推理巷
[Chorus] 拆 Z,稳流,别让外挂放大噪音 同批 rollout 算基线,多条好路一起通行 拆 Z,稳流,奖励不是独占的王 GFlowRL 把分布对齐,训练不再炸场
[Verse 2] β 乘奖励,参考策略,旧策略来对账 每条响应除以长度,别让长链垄断音量 importance sampling,修 rollout 和 trainer 的偏航 flow gap 非对称裁剪,给正向修正更多弹簧床
去掉 clipping,均分掉到 37.02 带裁剪回到 40.92,梯度均值也收住 GFlowRL 均值零点零七,最高六点一八 FlowRL 那条高压线,直接把优化炸出局
六项数学平均,七 B 对 GRPO 多八点四四 40.92 写在表里,模式多却不散队 代码三项全赢,14B 打到 2048 Elo 比 o1 高一百五十七,离 o3-mini 只差二十五
红队奖励更嘈杂,FlowRL 直接不收敛 GFlowRL AdvBench 八二点五,HarmBench 七九点五上线 多样性 3.93,GRPO 只有 1.21 不是只会追一个答案,是让有效分支都露脸
[Bridge] 三十 B,三 B active,Codeforces 1999 二百三十五 B,二十二 B active,数学 83.35 FlowRL 在稀疏路由又倒下,GFlowRL 还能稳住线 但论文也写清楚,固定点不是收敛的签名
长度近似一致,归一化才贴近原方 有限 batch 非凸路,谁都不能保证每步都赢场 这是拆掉无用机关,不是宣告所有问题投降 分布匹配留下,工程负担退场
[Chorus] 拆 Z,稳流,别让外挂放大噪音 同批 rollout 算基线,多条好路一起通行 拆 Z,稳流,奖励不是独占的王 GFlowRL 把分布对齐,训练不再炸场
[Outro] 不是加一层,就能把规模扛 先问哪一层,只是在制造噪响 GFlowRL,拆 Z,留下奖励分布的光 通勤一首歌,听懂推理训练换挡
来源
arXiv 论文摘要页
arXiv HTML 全文
関連コンテンツ
ログインするとコメントできます。
More from this channel
›
可说·中枢(J-space)
2026-07-21
漂移·承诺(Polestar)
2026-07-20
词表·扩容
2026-07-19
分叉·降噪(BPO)
2026-07-18
语法铁闸(GRID)
2026-07-16
晚塌·定案(DEGS)
2026-07-15
双焦·绕绳(Jet-Long)
2026-07-13
搜证·回炉(DeepSearch-World)
2026-07-12
View the full content archive of "每日大模型 Rap"
Explore more channels on Discover