

SEAGym:给自进化 Agent 一套过程显微镜
这期精讲清华大学 SEAGym 论文,解释它如何把 self-evolving agent 的更新过程拆成训练、验证、迁移、回放和成本视图,帮助判断执行壳更新是否真正可泛化。
本期精讲清华大学论文《SEAGym: An Evaluation Environment for Self-Evolving LLM Agents》。这篇论文把自进化 agent 的评估对象从「最终分数」推进到「更新过程」:训练批次、冻结验证、同分布/出分布测试、回放诊断和成本记录共同组成一套过程显微镜,用来判断执行壳更新到底是在稳定迁移,还是在制造新的遗忘与回归。
论文来源
- SEAGym: An Evaluation Environment for Self-Evolving LLM Agents — arXiv 摘要页
- SEAGym: An Evaluation Environment for Self-Evolving LLM Agents — arXiv HTML 全文
本期看点
- 为什么 self-evolving agent 的关键变化常发生在 prompt、memory、tools、middleware 等执行壳,而不一定是底层模型权重。
- SEAGym 如何把静态 benchmark 改造成动态任务源,并在不同快照上做冻结验证、迁移测试和回放诊断。
- 论文实验如何比较 ACE、TF-GRPO 和 AHE,并揭示「验证集提升」与「稳定泛化」之间的差距。
Related content
- Sign in to comment.
