AI 自己去调外壳:同一个 Agent,账单一口气少了三分之一

AI 自己去调外壳:同一个 Agent,账单一口气少了三分之一

同一个编码 Agent,同样把这些活干完,模型账单少了三分之一。

0:00 / 7:39
一个编码 Agent,同样把这些活干完,模型账单少了三分之一——换的不是模型,是模型外面那层壳。9 月 17 日,NVIDIA 与南洋理工、MIT 的研究者挂出预印本《SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness》,随后放出项目页与一个 MIT 许可的开源扩展:编码 Agent Pi 上的四个效率机制,而把这四个机制找出来的,是 AI 自己跑的自动研究循环。12
本期覆盖 9 月 17 日到 9 月 22 日公开的一手材料:预印本与项目页、开源仓库,以及它所回应的那篇对「自动演化 harness」评测方式的质疑。3

本期听什么

  • 它不是一个新模型。 SoL-Pi 是编码 Agent Pi 上的一个独立扩展,装在不带补丁的 Pi 上,四个机制默认全部关闭;认证、模型、shell 行为仍然归 Pi 管。45
  • 它省的是任务级的 token 用量。 常见做法是把单个 token 弄便宜,它反过来减少一件任务总共花掉多少 token:在 EdgeBench 的 51 道公开题上,记录到的 token 流量降 44.7%–49.0%,API 成本降约三分之一,同时保留 Pi 约 94% 的平均分。1
  • 找到这四个机制的是 AI 自己。 一个研究 AI 看另一个 Agent 跑基础 harness 的执行轨迹,提出改动,再在准备好的环境里逐个试:152 个候选方向、535 个可执行环境、三千多次运行。2
  • 四个机制分别在动工具调用、上下文压缩、观测存储和委派阅读。 四个机制都各留了一条退路:该分开走的还是分开、原件留在本地、要精确内容时按把手取回、验证不过就退回原文。1
  • 出了自己的考卷,它就没那么好看。 Terminal-Bench 4 的 63 道 CPU 任务上它解出 15 题,Codex 与 Pi 各 18 题,但总成本更低;作者自己说跨模型迁移目前只是初步证据。1

它不是新模型,是外壳上的一层扩展

这件事的做法说穿了很朴素:那篇论文把 harness 改进当成一个搜索问题——模型权重不动,基础 harness 也不动,动的是那层壳。之所以值得交给 AI 去做,是因为手工调太慢,而且部件之间是耦合的:工具、上下文管理、验证、委派、恢复、终止缠在一起,你在一个地方省下成本,很可能把它推到后面几步去。1
开源仓库里有几条工程细节值得先记住:它只导入 Pi 的公开 API,不改 Pi 的源码树;每个机制都是显式开启,缺配置就全部关闭;原始观测保留在本地,压缩机制失败的退路是原文;仓库要求 Node.js 22.19 以上与 Pi 0.85.1。压缩后的观测与日志回执存在本机会话目录里,不随会话结束自动删除,而日志回执那一步会把内容发给配置好的便宜模型,所以仓库的安全文档要求:不能让日志离开本机时就不要打开它。4

一百五十二个方向,筛出四个机制

搜索的规模是这样的:152 个候选方向分成上下文、进度、工具、委派、提示与策略、改进与评估六个家族;535 个可执行环境里,495 个来自 GitHub 上真实的 issue 与 pull request 配对(仓库状态取修复前,回归测试对 Agent 隐藏,且必须满足「补丁前失败、补丁后通过」),40 个是自带可执行验证器的合成任务;整个过程对应三千多次运行、六万多次 Agent 与环境交互。1
两条规矩是这套东西真正的关键。第一,验收标准在实验开始前就定死,而且负责优化的那个 Agent 碰不到它:每一项能力指标必须留在预先声明的容差内,同时至少改善一项效率指标,两条都过才留下。第二,考卷留着不给它看:EdgeBench 的 51 道公开题里,11 道只做一次单向验收,剩下 40 道留到最后评测;留出的结果从来不回到搜索里——一次验证失败就直接淘汰,不会触发继续优化。16

上个月刚有人质疑过这条路

7 月挂出、8 月更新过一版的《Rethinking the Evaluation of Harness Evolution for Agents》指出两个问题:harness 演化本身就是一次反复试错的搜索,所以应该跟同等反馈与推理预算下的简单基线比;而搜索和最终评测用同一套题时,涨的那部分很可能只是记住了这套题——比如把某次失败里找到的一个具体文件路径写进提示词。作者在 Terminal-Bench 2.1 上用 GPT-5.4 与 Claude Opus 4.6 做对照,结论是自动演化没有稳定赢过简单的测试期搜索,泛化也有限。3
SoL-Pi 的整个搜索设计就是在回应这一条:把候选的开发和留出验证彻底分开,留出结果单向流动。它能不能算数,取决于后面的独立复现,目前还没有。1

机制一和机制二:合并往返,压缩先算账

Action Fusion 针对的是重复往返:基础 Pi 常常先改文件,再单独发一条命令去测、去构建、去跑,那就把两件事并成一次工具请求,一次返回两个结果,省掉一轮模型往返。需要先看改动结果才能决定下一步的命令,仍然分开走。1
Online Context Compact 管的是什么时候压缩上下文。它不按固定规则压,而是按计划步骤完成这个时间点来算:Agent 用 update_plan 维护计划,每完成一步,harness 就估一次后面还剩多少请求,再比较「让上下文回到窗口内能省下多少输入」和「重写缓存前缀要额外花多少」。只有省下的输入压过改写成本才动手;越往后压要求越大的余量,因为前面的改写成本还没收回来。这里反直觉的一点是:压缩本身是要花钱的,因为它会打断缓存前缀的复用。1

机制三和机制四:给大结果一个把手,把日志交给便宜模型

ObservationPack 处理重复出现的大结果:超过 10 KiB 的工具输出先在本机存档,接下来两次请求仍然完整发送;从第三次请求起,模型看到的换成一个稳定的把手、原始大小,以及头尾几行的摘录,需要精确内容时按把手取回。小结果不改。1
Evidence-Preserving Reducer 把构建与测试日志(阈值 4 KiB)交给一个更便宜的模型写成一份紧凑回执,但它不信这份回执:一个确定性验证器要核对回执的结构、来源哈希、退出状态、逐字引用的原文和大小,只要验证没过、怀疑日志里有凭据、或者回执根本比原文大,就退回原日志。文件读取和搜索结果不走这条路。四个机制里,省钱的那一步都不能顺手把证据弄丢。1

省了多少,代价是什么

EdgeBench 是 51 道公开题(全套 134 题里已开源的部分),比较的是平均分、token 流量与 API 成本,价格取 8 月 17 日的官方 API 价。完整四机制那一档:GPT-5.6 Sol 上从 1,339 美元降到 894 美元,平均分从 44.8 到 42.0(保留 93.7%);换到 Opus 5,token 流量降 44.7%、API 成本降 33.5%,保留 94.3% 的平均分。跟原生 harness 比,GPT-5.6 Sol 上相对 Codex 的 API 成本降 50.0%(1,787 美元对 894 美元),Opus 5 上相对 Claude Code 降 54.3%(2,535 美元对 1,158 美元)。论文按小时给的估算是:相对 Codex 与 Claude Code 每小时省 8.75–13.50 美元,相对 Pi 省 4.36–5.71 美元。1
代价写在细节里。压缩让缓存前缀不再复用:GPT-5.6 Sol 上四机制全套把缓存读取流量从 2.1326B 降到 1.0605B token,缓存写入流量却从 0.0141B 涨到 0.0316B,总账仍然从 1,339 美元降到 894 美元。论文的判断是,要看一件任务的总成本,而不是只看缓存复用率。1
还有一个数字值得单独拎出来:作者选出的「表现点」不是四个机制全套,而是单个机制——GPT-5.6 Sol 上 ObservationPack 把平均分从 44.8 提到 47.2,Opus 5 上是 Action Fusion,提到 50.5(均为该后端得分最高的单机制配置)。省钱的组合和涨分的组合不是同一个。1

换一张考卷,和能抄回自己循环的四条

出了 EdgeBench 之后的三组结果,方向不完全一致。Terminal-Bench 4 的 63 道 CPU 任务上,Codex 与 Pi 各解 18 题,SoL-Pi 解 15 题,但总成本从 Pi 的 286.45 美元降到 211.12 美元,单题成本降 11.6%(15.91 美元到 14.07 美元)。IMO 2026 六道题、要求 Lean 4 形式化验证,三个 harness 都过 3–5 题(Codex 5 题、Pi 3 题、SoL-Pi 3 题),SoL-Pi 单题成本最低,20.90 美元。蜂群实验里,Codex 带 20 个 SoL-Pi 工人两小时跑到 1,127 个 cycles、花 60.11 美元,带 20 个基础 Pi 工人是 1,366 个 cycles、82.12 美元,而单个 Codex Agent 反而最便宜(1,333 个 cycles、39.20 美元)。17
作者自己圈的边界有三条:跨模型迁移只是初步证据,这些机制在 Opus 5 上触发得更少,可能因为搜索只用了 GPT-5.6 Sol 的轨迹;终端基准上它解出的题更少,省成本与保能力之间仍有取舍;所有数字都来自论文与项目方自己,用的是官方等价计价,目前没有独立复现。18
能抄回自己循环的有四条:先找出重复的往返(一次编辑跟着一条固定验证命令,合并收益最直接);大工具输出不是垃圾而是重复计费,留一个能精确取回的把手比直接摘要安全;让便宜模型读日志可以,但要有一个确定性检查吃得下它,并且准备好退回原文;压缩要算账,省下的输入对得上重写缓存的成本才做,上下文预算越紧越值。四条都不需要训练模型,也不需要换模型。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content