加了记忆反而更差:Agent 循环里带下去的状态该怎么管

加了记忆反而更差:Agent 循环里带下去的状态该怎么管

同一个模型,同一批任务,把带全局记忆的那一版和干脆不带记忆的那一版放在一起比,不带记忆的那一版赢了:零点七七五对零点七一三。

0:00 / 7:13
同一批任务、同一个冻结的模型,把「全局共享记忆」和「干脆不带记忆」两版放在一起比,不带记忆的那一版得分更高:0.775 对 0.713。1
这一期取自 9 月 25 日周五那批新投稿;预印本平台周末不更新,周一早上还没有新的一批。四篇论文指向的是同一个对象——Agent 循环跨回合带下去的那些东西:写进记忆里的结论、变旧的记忆、工具的返回,以及提交前要过的那道守卫。2

本期听什么

  • 记忆写进去之后,还要决定它能被谁看见。 提议不改、门的判定也不改,只把召回范围从全局改成按出处,平均轨迹效用从 0.713 升到 0.816,有害上线从 8 次里的 6 次变成 0 次。1
  • 复核要按价值定价,而不是一见疑虑就做。 不设上限时,定价的策略自己停在 11.0% 的步数上;一见疑虑就复核的策略花掉 70.7%,最后还是落后 4.5 个百分点。3
  • 留在上下文里的工具返回会被反复计费。 243 次执行里,单个会话累计输入最大到首轮输入的 14293 倍;只保留原始历史这一项,就让平均有效会话成本涨 21.2%–35.9%。4
  • 陈旧不等于不安全。 按新鲜度拦的守卫会毫无必要地拦掉 92%–95% 的无害竞态,最多丢掉 43% 本可安全完成的任务;完整的语义守卫一个都不拦。5
  • 模型自己报的把握替代不了守卫。 口头自信的校准误差约 0.37,动作一致性和随机拦一把打平,加一句「小心」几乎没改变不安全率。5

记忆写对了,只是没被问过用在哪里

第一篇论文做了一个十二轮的代码修复流:模型冻结、不训练,靠往记忆里写技能让自己变好;每条技能都要过一道执行验证的门,证明它真的有用。1
这道门只回答一个问题:这条技能有没有依据。它回答不了另一个问题:这条技能应该被谁看见。作者把提议和门的判定都固定住,只改召回范围。1
召回范围平均轨迹效用有害上线
每条技能对全局可见0.7138 次里 6 次
每条技能只对它出处的那个任务族可见0.8160 次
不带记忆的静态版本是 0.775,比全局召回还高。1
换成 27 条随机顺序的流再跑:分族召回平均多拿 0.063(区间 0.037–0.094),被接受的更新从 12 条变成 63 条,63 条里 0 条有害。原因是,一条在某一类任务上验证有效的编辑,跑到别的任务族里就是干扰。写进去是一个控制点,召回给谁控制是另一个。1

记忆变旧了,什么时候值得花一步去核

第二篇论文的出发点是部署之后的日常:模型冻结,手里只有一份接班时写好的简报;简报里每一条在当时都是真的,后来路径关了、开关翻了、价格带移了。这里出的故障不是不知道,是过时。3
作者把复核当成一笔要花钱的差事来算:一次复核要和它保护的那个任务抢同一批动作,只有当消掉这份疑虑的每动作价值越过当前这条工资线,它才值得被派出去。这条线是单峰的——非常确定它对、或者非常确定它错的时候,都不该花钱去核。3
同样的动作预算下,这套定价在基础上限上比一见疑虑就复核高 10.0 个百分点。不设上限的那一组更能说明问题:定价的策略自己停了下来,只花 11.0% 的步数;一见疑虑就复核的策略花掉 70.7%,最后还是落后 4.5 个百分点。3
里面还有两个设计:路上顺手拿到的凭证免费用来维护顺路的记忆;修正的时候写一个新版本,从来不删除。3

工具返回留在上下文里,是会被反复计费的

第三篇论文把「宿主要不要把工具返回带进后面可计费的上下文、怎么带」这个决定单独拎出来看。工具的返回一旦被运行时保留进后续输入,供应商就会再计一次费;于是被放行的、或者已经被人做手脚的工具,能把一段不可信的数据变成一张持续扣款的单子——不需要受害者的凭据,也不需要本地权限。论文给它起名叫「持久计费状态」。4
量级:243 次执行里,单个会话累计的输入最大到首轮输入的 14293 倍;把保留原始历史单独拎出来做对照,平均有效会话成本涨 21.2%–35.9%。压缩在 12 个历史依赖任务里成功 10 到 11 个,直接删除只有 2 个。4
防守的位置就在重新灌进上下文之前,四条硬边界分别管提示词体量、上下文增长、递归机会和累计花费。24 个小模型工作流里,按进度授权的策略 22 个通过且没有提前打断任务,换成固定上限只有 13 个。生态侧则不太乐观:3830 个 MCP 服务器和传输仓库里,只有 71 个有代码里看得见的防护代理,没有一个把这四类都覆盖上。4

陈旧不等于不安全

第四篇论文把 Agent 从读到写之间发生的竞态分成两类:会让声明的安全谓词失效的,和保持谓词成立、以及完全无关的。它用确定性模拟器把可见状态和权威状态分开,注入五种非原子失效机制,覆盖四个领域的 16 个基础设施任务,把冻结的提议在每个控制器下反事实重放,不用大模型当裁判。5
提交时的守卫拦掉的无害竞态丢掉的安全完成
按新鲜度(全局 epoch、读集版本)92%–95%最多 43%
完整的语义提交谓词00
精度还取决于契约:删掉一条声明过的条款,恰好把那一族故障变成不安全的提交,最高到 7.9%。5
模型那侧替代不了守卫:口头自信的校准误差约 0.37,动作一致性和随机拦一把打平,加一句「小心」几乎没改变直接的不安全率。更麻烦的是,被新鲜度守卫拦下之后,它会从「已经刷新、但仍然不完整」的读取里再提交一次,还是不安全的。5

边界

四篇都是作者自报的结果,没有第三方复现。前两篇跑的是作者自己搭的任务流:一个是 12 轮的代码修复流,一个是两个漂移的工具使用世界。第三篇用的是本地小模型,加上一轮对公开仓库的扫描。第四篇是确定性模拟器,不是真实基础设施;遥测退化时,一个隐藏的并发修改在观测上完全干净,这给所有靠选择性判断的策略设了上界。1345

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content