
唐杰THU 7月14日双平台更新:IndexCache 与 SAO
梳理唐杰THU在微博与 X 同日发布的两条原创动态,解释 IndexCache 如何降低稀疏注意力开销,以及 SAO 如何改进 Agent 强化学习训练稳定性。
先看最新动态
本轮双平台时间线显示,唐杰 THU 在 7 月 14 日下午连续发布了两条与大模型工程有关的原创内容:微博先谈 IndexCache 如何减少稀疏注意力的索引开销,X 随后转向 SAO,讨论如何让面向 Agent 的强化学习训练更稳定。按北京时间,微博发布于 14:20,X 发布于 14:14,前者是本轮抓到的最新一条。
| 平台 | 动态 | 发布时间(北京时间) | 抓取时互动数据 |
|---|---|---|---|
| 微博 | IndexCache:跨层复用稀疏注意力索引 | 7 月 14 日 14:20 | 139 赞、39 转发、14 评论 1 |
| X | SAO:面向 Agent 强化学习的单 rollout 异步优化 | 7 月 14 日 14:14 | 1092 赞、108 转发、36 回复、127611 浏览、547 书签 2 |
微博:把稀疏注意力的重复计算省下来
微博内容介绍了团队的 IndexCache 论文。唐杰写道,DSA 让注意力计算变快后,仍留下一个隐性的 O(L²) 开销:每一层都要重新计算 indexer。IndexCache 的观察是,相邻层挑选的 token 往往相近,因此可以让多层共享索引,而不必每层都保留一套自己的 indexer。
原帖给出的结果是:indexer 计算量减少 75%,prefill 最高提速 1.82 倍,并已在 GLM-5 生产级模型上验证。这里的重点不是再换一个模型结构,而是把稀疏注意力已经获得的计算收益继续兑现到长上下文推理的前处理阶段。1
X:异步强化学习要兼顾速度和稳定
X 上的最新帖子指向论文《Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning》。唐杰概括称,SAO 可以稳定训练 1000 步,并在 SWE-Bench Verified、BeyondAIME 和 IMOAnswerBench 等 Agent 编程与推理基准上持续超过 GRPO 及其变体。2
论文摘要补充了方法细节:SAO 用每个 prompt 一条 rollout 的采样方式替代 GRPO 的组采样,并结合价值模型训练设计,以降低异步训练中的 off-policy 影响;同时使用严格的双侧 token 级裁剪来改善优化稳定性。论文还称,这套方法已经用于开放模型 GLM-5.2 的 Agent 强化学习训练流程。3
这些指标目前是论文作者在摘要和原帖中报告的结果,文章没有把它们写成独立复现结论。对读者而言,真正值得继续看的是:异步训练能否在更长的 Agent 轨迹和更多动态环境中保持优势,而不是只在单个训练设置下提高吞吐或分数。
放在一起看
两条动态位于大模型工程栈的不同位置:
- IndexCache 面向推理侧,处理的是稀疏注意力在长上下文 prefill 阶段的索引计算成本。
- SAO 面向训练侧,处理的是 Agent 强化学习中 rollout 到达不同步后,如何减少分布偏移并维持训练稳定性。
把两条放在同一天看,可以看到一条清晰的技术关注线:模型能力之外,长上下文和长程任务的成本控制也在被拆成更细的工程问题。前者压低一次推理的计算负担,后者试图改善训练复杂 Agent 行为的流程。它们并不是同一项技术,也不能据此断言 GLM 已经解决了长程任务,但值得作为后续模型更新和技术报告的两个观察点。
本轮覆盖说明
本轮读取了微博「唐杰 THU」和 X「@jietang」的最新公开时间线,入选的两条均为账号原创发帖。返回的最新列表没有提供可核验的带观点转发或本人回复标记,因此没有把评论区他人留言或无法确认类型的条目归为唐杰本人的观点;后续若出现带明确标记的转发或回复,将单独列出。
参考ソース
関連コンテンツ
- ログインするとコメントできます。
