换个外壳,第一名就换人:Agent 榜单测的是模型还是系统

换个外壳,第一名就换人:Agent 榜单测的是模型还是系统

同一个 Claude 模型,在 OpenHands 这个外壳里比 GPT 高七点九分;换到另一个外壳上,反过来低三十点二分。同一批题、同一套参数,唯一换掉的就是外面那层壳。

0:00 / 6:57
同一个 Claude 模型,装进 OpenHands 这个外壳里跑,比 GPT 高 7.94 分;换到另一个外壳 PI 上,反过来低 30.16 分。题目是同一批,参数也基本一样,换掉的只有外面那层壳。这一期四篇论文说的是同一件事:一张 Agent 榜单排的不是模型本身,是模型、外壳和任务撞在一起的那一下。1
这一期取自 9 月 30 日到 10 月 1 日提交、北京时间 10 月 2 日早上挂出的那批新投稿,cs.AI 新投稿 149 篇、整页 568 条条目。今天是 10 月 5 日周一,arXiv 上挂出的仍是这一批——周末不更新,周一那批还没出来;上一期已经用掉其中一条线,这一期换到另一条。2

本期听什么

  • 同一个模型,换个外壳名次就翻。 66 种配置、4 个可换外壳、5 个模型、3 个终端类基准:在 Terminal-Bench 4 上,Claude 在 OpenHands 里领先 GPT 7.94 分,在 PI 里落后 30.16 分。5 个模型里有 4 个,换一个基准,最优外壳就换人。1
  • 榜单能信几成,取决于你想问哪句话。 对 22 个榜单做方差分解:问「这套模型加外壳的组合行不行」,排名可靠性 0.935–0.994;问「哪个模型本身更强」,掉到 0.148–0.841。外壳覆盖不足主导时,任务加到无穷多,模型排名可靠性最多再抬 0.097。3
  • 你自己那一套的一半方差,来自重跑同一个配置。 4 个科研任务、5 个配置维度:约 54% 的结果方差来自重复同一配置;影响最大的是给 Agent 的任务信息,超过时间预算,也超过模型规模。4
  • 最终分数过了,过程还有九成二有问题。 企业场景 240 次试验:175 次通过全部最终数值检查,其中 162 次(92.6%)另有被过程检查抓出的偏差;换成更宽的七项终态定义,164 次通过里仍有 151 次(92.1%)违反某条轨迹检查。5
  • 四篇合起来给了一条顺序。 先确定要问的是哪句话,再把模型、外壳、任务放一起测,然后判断加题能不能解决你那份不确定性,最后给过程留一层检查。

六十六种组合里的名次反转

Finding the Right Fit 的作者是 Yixuan Li、Yiyun Zhou、Yao Long Teng、Fuchao Yang、Yanchen Deng、Zhiyi Lyu、Xuyu Dong、Feng Chen 和 Bo An,九个人,19 页 9 图 6 表。他们把「选一个 Agent 系统」拆成两件事:选模型,和选模型干活时经过的那个外壳。然后系统性地比:四个可以换的外壳(OpenHands、DeepSeek Harness、PI、openJiuwen)各配五个模型,跑 TUA-Bench、ALE-CLI 和 Terminal-Bench 4 三个终端类基准;另外还带上原生配对的 Codex-GPT 和 Claude Code-Claude。1
一共 66 种配置。第一个结论就是模型的名次会随外壳反转。在 Terminal-Bench 4 上,Claude 在 OpenHands 里领先 GPT 7.94 分,到了 PI 里落后 30.16 分——前后差 38 分。五个模型里有四个,换一个基准,最好的那个外壳就换人。1
有反转,也有稳的搭档。Kimi 在三个基准上的最高分都来自同一个外壳 openJiuwen,比其他外壳高出 5.61 到 11.11 分。论文另外两条对选型很直接:厂商自己配的原生外壳,不一定是这个模型跑得最好的外壳;成本高也不等于分高——GPT 在 PI 上的分数高于 DSH,而每个任务的花费不到后者的四分之一。1
他们还去读了配对的轨迹,想解释「契合」为什么因人而异。原因是模型几乎所有的修复动作都是它自己发起的,所以很吃外壳把失败交回给它的形式。GPT 配 PI 那种轻脚手架跑得最好;Kimi 经常发出格式不对的工具调用,配 openJiuwen 最顺。适配器、评测代码和全部 6,204 条打过分的轨迹都已公开。1

榜单可信到什么程度

既然换个外壳就能翻盘,那现成的榜单还能信几成。Agent Evaluation Reliability 的作者是 Michael Hardy、Ruhana Azam、Anka Reuel、Mykel Kochenderfer 和 Sanmi Koyejo。他们拿了 Holistic Agent Leaderboard 和 Harbor Index 上的 22 个榜单,做了一次贝叶斯方差分解:把分数里的变化拆成两块,一块是真正跟你想要的那个结论有关的差别,另一块是无关、但照样能改变名次的抖动。3
拆完的第一件事:可靠性取决于你要回答什么。如果你问的是「这套模型加外壳的系统行不行」,那 22 个榜单排得相当稳,可靠性在 0.935 到 0.994。如果你问的是「哪个模型本身更强」,那就不稳了,只有 0.148 到 0.841。同一个分数,支持前一个结论,未必支持后一个。3
第二件事:外壳会改结论。榜单之间的「外壳间可靠性」——换一套脚手架,模型之间的名次还保不保得住——差异相当大。3
第三件事最硬:加题救不回来。当不确定性主要由外壳覆盖不足贡献时,就算把同一类题加到无穷多,一个基准对模型排名的可靠性最多也只能再提高 0.097。反过来,把几个不同的基准并起来更划算:在同样的题目预算下,跨任务排名的可靠性从 0.44 抬到 0.75,成本最多还能降 83%。论文的建议很直接——先想清楚一个分数该代表什么,再诊断是什么在限制它的可靠性,然后把预算花在真正重要的那块不确定性上。3

你自己那一套系统的一半方差

榜单说的是别人搭的系统。Agents Are Systems, Not Models 问的是你自己那一套。作者是 Luis Wiedmann、Leander Girrbach、Cordelia Schmid 和 Zeynep Akata。他们的出发点是:评测一直把 Agent 当成一个固定的东西,可实际上它是一个可以配的系统——你决定告诉它多少信息、让它跑多久、用哪个模型,每一个选择都会改变它跑得怎么样、稳不稳。4
他们造了一个新基准,四个科研任务:一个会写代码的 Agent 要找到一篇论文里的那个专用模型,并且把它正确地跑起来。然后在五个地方动手:给它的任务信息、要不要推理、要不要自我核查、时间预算、底座模型。4
结果里约 54% 的方差来自同一个配置重跑,而不是来自换配置——也就是说,一半以上的抖动根本不是你在比较的那些选项造成的。真正的差别里,影响最大的是给它的任务信息,超过时间预算,也超过模型有多大;而且信息给足之后,成本反而降低,校准还更好。配置之间还会互相咬:加时间,只在它信息够了、或者模型够强的时候才有用。4
论文还给了一个很好用的观察:你在提示词里要求它去核查,几乎不改变它实际的核查行为;但如果给它一个专门用来核查的工具,行为就明显变了。有些你想要的行为,做进系统里比写在提示里管用。18,000 多条轨迹随论文放出。4

最终分之外的第二层检查

前三篇都在说测什么,最后一篇说怎么测,而且是上线那一头。Continuous Process-Level Evaluation 的作者是 Ngoc Phuoc An Vo、Aarya Doshi 和 Vadim Sheinin,进了 NeurIPS 2026 的 CLEA 研讨会。研究对象是企业里的一套 Value Aware Resiliency 系统,具体是 Revenue 和 Productivity 两个 Business Value Determination 技能。5
企业里的 Agent 技能一直在变:工具接口会改,模型会换,规格也会调。论文担心的是,只看最终输出,会漏掉过程中的行为漂移。所以他们做了两层检查——一层看结果,一层看过程:工具选得对不对、参数对不对、执行顺序对不对、数据库有没有被写坏;过程这一层用程序化检查加一个范围很窄的 LLM 判官,归因则顺着依赖关系做。5
一共 240 次试验,横跨两个技能、两种规格、两个外壳、三个模型。最刺人的数字是:175 次通过了所有适用的最终数值检查,其中 162 次,也就是 92.6%(Wilson 95% 置信区间 87.7%–95.6%),又被过程检查找出了别的偏差。换成一套更宽的、包含七项终态检查的定义,164 次通过里仍有 151 次、92.1%(区间 86.9%–95.3%)违反了某条轨迹检查。5
归因那一层也值得记:一次运行平均会报出 6.34 个失败的检查,顺着依赖关系收一收,能收到 2.65 个根因。规格的敏感度则因模型和外壳而不同。论文自己承认,在真实 API 持续演进的情况下做纵向验证,还是以后的工作。5

边界

  • 四篇都是作者自报的结果,没有第三方复现。1345
  • 第一篇的 66 种组合用的是作者自己挑的四个外壳,换一批外壳,结论还可能变;原生配对的两家只是作为对照,不是同一套受控条件。1
  • 第二篇用的 22 个榜单本身各有各的偏差,方差分解的结果依这些榜单而定。3
  • 第三篇只有四个科研任务,基准是作者自建的,而方差这一项本来就吃运行环境;54% 这个数说的是这套基准上的情形。4
  • 第四篇是企业内部的一个技能场景,240 次试验也集中在这两个技能上,纵向验证尚未完成。5
这四篇合起来,其实只回答了三件事:代价有多具体、边界在哪里、补救从哪一步开始。它们都没回答的是:如果你手上根本没有评测预算,只能先上线,那该先测哪一样。
回到开头那个 30.16。你看到的那个分数,测的从来不只是模型——它测的是模型、外壳和任务撞在一起的那一下。而这三样里,最容易换、也最容易被忽略的,恰恰是中间那层壳。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content