换个模型,整段对话作废:Agent 循环的账其实记在缓存上

换个模型,整段对话作废:Agent 循环的账其实记在缓存上

把简单的活派给便宜的模型,这一招在 Agent 的循环里经常是亏的:整段对话的缓存只属于一个模型,中途换人,等于把前面所有内容按原价重算一遍。

0:00 / 8:02
一份企业级预印本论文把 Agent 的账目单位换了一遍:不是一次接口请求,而是一个用户回合。论文题为《Control the Harness, Control the Cost: Routing and Governing AI Coding Agents in the Enterprise》,署名作者来自埃森哲的负责任 AI 团队,2026 年 9 月 24 日提交,cs.AI,32 页、13 张图、8 张表。1
它给出的核心结论是一条反直觉的成本规律:在一段很长的 Agent 会话里,价目表上最贵的那一档可能比次贵的那一档更便宜;而「把简单的活派给便宜模型」这个直觉,放在这个循环里经常是亏的。2
今天是 9 月 27 日,周日;预印本平台周末不更新,本期取自 9 月 25 日周五那批新投稿。3

本期听什么

  • 账单的单位是一个回合,不是一次请求。 十八个工具步的一轮,就是十九次接口请求,每一次都把整段对话重发一遍。2
  • 中途换模型的回本次数可以直接算。 从次贵那档换到中档要 27 次请求,不换回来是 8 次;从最贵那档换,要 291 次。2
  • 长会话里,最贵那档反而更便宜。 18 个工具步一轮时,上下文超过 6.5 万 token,最贵那档的一轮就比次贵那档便宜。2
  • 能换模型的位置只有三处。 会话开始、侧车道、子智能体启动;三处之外动它,只会白付两笔缓存写的钱。2
  • 同一个机制,厂商文档也确认了。 每个模型有自己的一份提示词缓存,换模型时下一次请求要把整段对话重读一遍。4
  • 一万个座席,一年省 330 万到 500 万美元。 节省的四分之三来自上面的交叉点。2

谁在替你挑模型,谁来买单

论文的第一句就把责任划到了产品上:决定每次请求用哪个模型、模型读到什么、缓存怎么用、子智能体跑在哪台模型上的,不是你,是你买来的那个 harness。2
价目表上有四档价,选中哪一档、买多少量,都由 harness 替你决定。企业只谈判价格,等于把账单连同治理一起留给了厂商的默认值。论文把随之而来的风险列了四条:被绑在一家的价格与限流上;闭源让企业看不到以自己的名义发出去的内容;技能与连接器能搬走,控制面搬不走;以及同样一笔钱在新手手里只买到一半成果。2
最后一条有数据:对约 40 万次 Claude Code 会话的分析中,被评为新手的使用者,会话验证成功的比例是 15%,中高级是 28% 到 33%;新手会话里有 19% 最后被放弃。论文的落点是:培训只能覆盖一部分人,改 harness 的默认值能覆盖每个人,而且不按人头加钱。2

一轮不是一次请求

一个用户回合里,模型会多次调用工具;有 k 个工具步的一轮,就是 k+1 次接口请求,每一次都把到目前为止的整段对话重发一遍。论文举的例子是十八个工具步的一轮,等于十九次请求。2
厂商对这段重发是有折扣的,叫提示词缓存:请求的前缀与不久之前发往同一个模型的前缀逐字相同,输入就按缓存读的价格计费。三条约束决定这笔账:前缀必须逐字一致;缓存属于那一个模型;缓存几分钟就过期,写入还有溢价。2
论文整理的三家规则(2026-09-21 与 09-23 的公开价目):缓存读是输入价的 0.1 倍(其中一档只要 0.025 倍),缓存写是 1.25 倍,长时效缓存写是 2 倍,寿命 5 分钟或 1 小时,最小可缓存前缀 512 到 4096 个 token。厂商文档把同一件事说得更直白:每个模型有自己的一份缓存,切换模型意味着下一次请求会整段重读,哪怕内容完全相同。24
于是路由在聊天产品里和在这个循环里是两件事:聊天里每条请求都可以随便挑模型,循环里换一次模型就是把整段对话按写入价重算一遍。2

中途换模型,要多久回本

论文把回本条件写成了一个公式:把目标模型的写入价、原模型的写入价、两边的读取价代进去,就能算出中途中换一次、之后还回原模型,至少要跑多少次请求;如果换出去就不回来了,门槛更低。2
换法之后还回原模型换出去不回来
次贵那档 → 中档27 次请求8 次请求
最贵那档 → 中档291 次请求46 次请求
按九月底的价目表:次贵那档的用户,几个连续的常规回合就够回本;最贵那档的用户,在一个任务里怎么换都是亏的。2
同一笔账里还有一个更省事的杠杆:缓存寿命。寿命是五分钟时,用户暂停一会儿回来,整段对话要按最贵那档的写入价重写;把寿命放到一小时,案例里的节省从 13.8% 抬到 17.1%,这是最便宜的一个默认值改动。24

长会话里,最贵那档反而更便宜

论文里最反直觉的一条是交叉点。最贵那档的输入与输出价是次贵那档的两倍,但缓存读价只要一半,而长会话里缓存读占大头——工具步一多,最贵那档的一轮反而更便宜。2
每个用户回合的工具步数最贵那档开始更便宜时的上下文
338.5 万 token
621.1 万 token
1210.5 万 token
186.5 万 token
303.2 万 token
真实会话上也核过:两个公开语料里,在次贵那档上花费超过 100 美元的会话,换成最贵那档更便宜的比例是 51% 和 80%。而且花费高度集中——最贵的 1% 会话吃掉全部花费的 31% 到 53%。案例里四分之三的节省来自这一条。2

能换模型的只有三个位置

结论是位置比模型重要。论文只给出三处能换的地方。2
  1. 会话开始时定模型。 跑起来之后不要改;新任务开始是重新选的机会。
  2. 把小的独立任务放进侧车道。 另起一段对话,只喂一份项目账本而不是整段记录;跑完发一次空请求把主对话的缓存预热回来,结果作为一条笔记追加在后面。论文的例子里,80 万 token 的会话中改一行,就地做是 0.88 美元,放进侧车道是 0.36 美元,账本与预热都算在内。
  3. 子智能体在启动时路由。 子智能体本来就是一段全新对话,换模型不欠缓存债;五个典型的子智能体,跟着父模型跑是 4.88 美元,换成中档是 1.27 美元,而父对话自己那一轮都是 0.24 美元。
三处之外别动。厂商文档里还有一条配套的坑:走网关时,一部分请求参数要靠请求头原样转发,转发器改掉它,后面的账单就全是未缓存的输入价。24

按住不动,比换错便宜

判断由谁来下?论文用的是一个决策模型,把每条提示词按自建分类打标签:动作、领域、难度、对历史的依赖四个轴,半秒内出结果;在 130 万次被路由的回合上,分类开销约每月 179 美元。2
它只在有足够把握时才动手:在可以降档的回合里,有四成二被按在原模型上不动。这是有意做成的不对称——按住了只是少省一点钱,换错了要付纠错链的钱。案例里纠错占了账单三分之一以上,动过的回合里有 12.5% 是误降级。2
治理那半篇同样克制:控制面放在网关,遥测只报聚合数据,按领域设底线(法务、财务、人力不降到中档以下),并且刻意不做按人统计的生产力指标,因为在欧盟这类员工监控落在高风险条款下。2
论文还给决策排了一个阶梯:先把默认值配置好,再在现有 harness 后面加自己的控制面,最后才认真考虑自建。另一笔账是不换家——同一批真实会话按 9 月 23 日的价目表重算,别家的强模型价格是次贵那档的 0.12 到 0.80 倍,前提是你选的 harness 允许接别家的端点。2

能搬回自己循环的四条

  1. 把账单单位从一次请求改成一轮会话,把工具步一起算进去。
  2. 别按价目表排名选模型,按会话成本选:上下文长、工具步多的活,最贵那档可能是最便宜的。
  3. 只在会话开始、侧车道、子智能体启动这三处换模型,再加一个免费杠杆——把缓存寿命调长。
  4. 把纠错的成本算进路由的账里:宁可按住少省一点,也不要在长对话里随便降档。

边界

这是一篇企业视角的仿真论文:46 个会话、109 个回合的场景是作者自己写的,标签也由作者自己打;只有策略与模拟器被实现,网关和钩子只到设计。作者按每个工程师每天 40 美元的模型消耗做案例,落在公开语料重度用户的中位数(15 美元)与均值(58 美元)之间,而厂商自己报的平均值只有约 13 美元;换成公开语料中停顿更多的用户,节省掉到 7.4%。2
更要紧的是,这一整套结论吃的是缓存读价的差:如果所有模型的缓存读都统一成 0.1 倍输入价,交叉点就消失,案例里的节省掉到 5%。论文的模拟器、场景目录与分类标签都没有公开,也没有第三方复现。12
覆盖窗口为 2026-09-24 至 2026-09-25:论文 9 月 24 日提交,9 月 25 日进入预印本列表。本期未采用任何二手转述作为事实来源。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content