
EdgeBench:字节 Seed 把 Agent 评测拉到 12 小时之后
解读字节 Seed 新发布的 EdgeBench:它如何把 Agent 评测从一次提交改成 12 小时长程环境学习,并用 134 个任务和约 3.8 万小时交互记录观察模型如何从反馈中变强。
字节 Seed 发布的 EdgeBench 把 Agent 评测从「答对一次」拉长到「连续做 12 小时后还会不会变好」:134 个真实任务、约 3.8 万小时交互记录,论文声称跨任务平均后的环境学习曲线可以用 log-sigmoid 函数高精度拟合,平均 R² 达到 0.998。12 这不是又一个刷榜集合。它更像是在问:当模型进入一个陌生工作环境,拿到错误信息、测试结果、评分反馈和自己的中间产物后,能不能把这些经验转成下一轮更好的动作。
EdgeBench 到底在测什么
EdgeBench 的核心词是「环境学习」。这里的环境不是聊天上下文,而是一个可执行任务空间:代码仓库、测试器、模拟器、证明检查器、游戏回合、隐藏评测器,都可能成为反馈来源。Agent 不是提交一次答案就结束,而是在工作区里反复试、改、提交,再根据本地反馈和隐藏评测反馈更新策略。2
论文把 134 个任务分成六类:科学与机器学习 39 个、系统与软件工程 36 个、组合优化 19 个、专业知识工作 19 个、形式数学与定理证明 13 个、交互游戏与模拟器 8 个。任务都被设计成至少可连续运行 12 小时;有人工投入记录的任务中,专家完成单个任务平均需要 57.2 小时,最高达到 320 小时。2
这套设计想避开一个老问题:短评测容易测到模型已经背过或训练中见过的东西。EdgeBench 更关心模型在任务内怎么学。一个软件任务里,本地测试失败会给它方向;一个优化任务里,分数变化会告诉它哪些启发式值得保留;一个 Lean 证明任务里,证明检查器会指出剩余目标。它测的是这种「边做边校准」的能力。
关键发现:平均曲线很规整,单个任务并不规整
论文最醒目的结论是:把 134 个任务按交互时间聚合平均后,模型表现随时间提升的轨迹接近 log-sigmoid 曲线。论文报告,全量 12 小时窗口里,五个模型的拟合 R² 都不低于 0.997;扩展到 28 小时和 72 小时的较小任务子集时,拟合 R² 仍不低于 0.993。2

这里要小心读。论文并不是说每个任务都会平滑变好。相反,全文反复强调单任务曲线很嘈杂:有的平台期,有的突然跳升,有的会倒退。log-sigmoid 是「任务总体平均」后出现的规律。作者给出的解释是,把任务看成潜在图结构后,Agent 的进展类似在图上扩张前沿:已解锁的部分会帮助解锁相邻部分,剩余未解锁部分又限定了进步空间。这个模型能导出一个随 log 时间变化的 S 形增长式。2
这点对读者有实际含义:不要把某个 Agent 在单题上的一次跳分当成稳定能力,也不要因为它前几个小时没动静就断言它不会学。长程任务里,评测对象可能在第 4 小时才定位瓶颈,也可能在第 10 小时还只是重复无效试探。
榜单数字说明了什么
论文评测了 Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1 和 DeepSeek-V4-Pro。全量 134 任务在 12 小时预算下,Claude Opus 4.8 总分 51.3,GPT-5.5 为 48.4,GPT-5.4 为 39.3,GLM-5.1 为 37.4,DeepSeek-V4-Pro 为 31.0。2
| 模型 | 2 小时 | 12 小时 | 12 小时代码类 | 12 小时形式数学 |
|---|---|---|---|---|
| Claude Opus 4.8 | 39.0 | 51.3 | 67.4 | 55.0 |
| GPT-5.5 | 36.8 | 48.4 | 65.0 | 50.0 |
| GPT-5.4 | 29.7 | 39.3 | 54.1 | 40.8 |
| GLM-5.1 | 26.0 | 37.4 | 50.9 | 24.6 |
| DeepSeek-V4-Pro | 23.3 | 31.0 | 43.0 | 14.1 |
这些数字不能简单读成「谁更聪明」。EdgeBench 同时测了模型、Agent 外壳和运行方式。论文写明,GPT 系列用 Codex 跑,GLM-5.1 和 DeepSeek-V4-Pro 用 Claude Code 跑,Claude Opus 4.8 主要用 1M compact window 的 Claude Code 跑。也就是说,榜单里混有模型能力、上下文长度、工具链、提交策略和评测框架适配程度。2
更有价值的是动态指标。论文发现,从 2025 年 9 月的 GPT-5-Codex 到 2026 年 4 月的 GPT-5.5,固定 18 任务切片上的两小时学习速度约提升 8 倍;作者用前沿模型点做 log-linear 拟合,得到大约每三个月翻倍的趋势。2 这不等于未来一定按这个速度继续走,但说明 Agent 时代的关键变量可能不只是初始答题能力,还包括「拿到反馈后改进得有多快」。
最值得看的两个消融
第一,论文试图排除「跑久了只是抽样更多」这个解释。研究者让 Opus 4.8 在 17 个任务上用同样的 12 小时预算比较两种方式:一种是连续运行、保留工作区和反馈历史;另一种是拆成 6 次独立的 2 小时尝试,只取最好结果。12 小时时,连续经验曲线达到 43.0,独立重启基线为 36.1,差距是 6.9 分。2
这个结果支持一个朴素判断:长程 Agent 的状态管理不是可有可无。它需要记住哪些尝试已经失败、哪些局部改动有效、哪些反馈可信。只靠重新开很多次局,拿不到同样的收益。
第二,论文比较了 200k 与 1M 上下文的 Opus 4.8。在 42 个任务子集上,1M 上下文版本在 2 小时、6 小时、12 小时分别领先 5.8、5.5、4.4 分;12 小时得分为 52.5,对照组为 48.0。2 这说明外部工作区、文件和压缩记忆并不能完全替代长上下文。长任务里,模型能直接保留更多近期证据,仍然会带来稳定收益。
开源部分够用,但不是全量复现
Seed 官方博客写明,EdgeBench 目前开源 51 个任务和完整评测框架;GitHub README 也给出 51 任务开源子集、SForge 两容器评测框架、官方实验配置和 Hugging Face 数据入口。13 这对研究社区是有用的,因为至少可以检查任务形式、跑开源子集,并复用工作区 / 评测器隔离的设计。
但全量论文结论仍依赖未全部开放的 134 任务和大量算力运行。读者如果要判断「log-sigmoid 是否真是环境学习的普遍规律」,还需要看后续是否有独立团队在不同任务池、不同 Agent 框架和不同模型组合下复现。开源 51 个任务能启动复核,但还不能直接复现所有论文图表。
这篇对 Agent 评测的提示
EdgeBench 最有价值的地方,不是给了一个新的总分,而是把评测对象从「模型知道什么」改成「模型如何在环境中更新自己」。这会迫使评测设计更接近真实工作:必须有可执行环境、可区分本地反馈和隐藏反馈、能记录完整轨迹,也要防止模型直接接触隐藏评测资产。论文中的 SForge 就采用 work 容器和 judge 容器隔离,Agent 只能看到工作环境,隐藏测试留在 judge 侧。23
它的边界也很清楚。论文排除了主要难点在视觉理解、尤其是 GUI 操作的任务,因为这会把环境学习能力和视觉骨干能力混在一起。2 作者还说明,log-sigmoid 规律不应被外推到所有环境学习过程;如果任务图有强瓶颈、任务中点分散、前沿速度差异很大,或者任务结构不是近似尺度自由,这个规律可能失效。2
所以,EdgeBench 更像一个早期坐标系:它告诉我们,长程 Agent 的评测要看学习轨迹、经验累积、上下文保留和反馈利用,而不是只看最后一次提交的分数。至于这条 log-sigmoid 曲线会不会成为 Agent 时代的「预训练 scaling law」对应物,还需要更多公开任务和独立复现来回答。
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
