两道判官,只抵一道半:Agent 循环里的检查到底多挡了多少

两道判官,只抵一道半:Agent 循环里的检查到底多挡了多少

给 Agent 循环外面加检查层的人,大多默认一件没有量过的事:每一层的错误各自发生,叠两道判官就等于两道防线。可实测下来,两道判官叠在一起,只等于一层二到一层四。

0:00 / 6:21
给 Agent 循环外面加检查层的人,大多默认一件没有量过的事:每一层的错误各自发生,叠两道判官就等于两道防线。实测下来,两道语言模型判官叠在一起,只等于 1.2 到 1.4 层;规则层加一个判官,也只有 1.86 到 2.09 层。这一期四篇论文讲的是同一件事:循环里那道检查,到底多挡住了多少。1
这一期取自 10 月 7 日周三挂出的那批新投稿,cs.AI 整页 507 条条目、新投稿 156 篇,论文提交日期在 10 月 5 日到 10 月 6 日之间;上一期用的是 10 月 6 日那批,这一期换掉了。2

本期听什么

  • 两道判官叠起来,只等于一层二到一层四。 六对判官组合里六对都是显著正相关,它们的错误不是各自发生,而是一起发生;规则层加一个判官折算出来是一点八六到二点零九层,但四对里一对都不显著,也就是几乎一起动。1
  • 单独一层有多准,预测不了它叠进去之后多挡了什么。 一个云规则包把规则层自己单独漏检的比例降了两成,联合覆盖一点没加。1
  • 判官那一档会悄悄换模型。 112 个批次里有 50 个批次,判官被服务成了没有要求过的模型版本;这件事推翻了作者事先定好的分析规则,也让五个结论反了向。1
  • 规则和判官有各自的地盘。 28 条确定性检查的级联加四个判官的合议,在四个领域把攻击成功率从约 30% 压到约 3%;被挡下的攻击里 78% 由确定性检查处理,安全运营域只有 四分之一 的提案会走到判官面前。3
  • 闸门要拿已知真值来测。 往候选池里注入已知的正确答案、再配一个同准入率的随机对照:赢不过这个对照,闸门就只是在抬高门槛。弱信号下它消掉假发现,代价是把准入率压到 1%–7%;强信号下它什么也没多带来;条件算在绝对收益而不是超额收益上时,它会静默拒掉每一个候选,连真信号一起拒掉。4
  • 多挡一层也有代价。 200 对只差一处证据的仓库任务、8 个代表性模型:在证据写得很清楚的情况下,不必要的风险处置发生在 11.2%–58.7% 的运行里;任务能力更强不代表处置更合适,而处置错了会明显伤害开发者。5

两道判官叠起来,只挡住一层多

第一篇是 Chenglin Yang 的《Evaluate the Stack, Not the Layer: Do Deterministic and LLM Gates for Agent Actions Fail Independently?》,15 页、1 图、10 表,代码和数据在 GitHub 上。它问的问题很基础:运行时那道拦住 Agent 动作的检查,叠起来到底等于几道。1
他的做法是先定一个读数,叫等效层数:把一整个检查栈折算成相当于几层完全独立的防线,并给出完全耦合时的地板值。材料是 1,119 条已经标好的 Agent 动作,来自三个语料库,全程没有会自适应调整的攻击者。这个栈是一层确定性规则,加四个语言模型判官,其中三个判官重新采集过,每一次调用的实际服务模型都被记了下来。1
关键结论在耦合上。严格口径下——把人升级处理也算作没拦住——任意两个判官叠起来只等于 1.2 到 1.4 层,六对组合六对都显著正相关,完全耦合地板是 1.02 到 1.17;规则层加一个判官是 1.86 到 2.09 层,但四对里一对都不显著,地板只有 1.01 到 1.09。换成把升级算作拦住的宽口径,两段分别是 1.21 到 1.57 和 1.80 到 2.13。区间在合并数据上能分开,但拆到单个语料库上点估计就分了岔;换一个第三方厂商的判官,它落回判官那一档。1
还有一条更实用的:单独一层有多准,预测不了它叠进去之后多挡了什么。作者往规则层里加了一包云规则,规则层自己单独漏检的比例降了 20%,可联合覆盖一点没加。判官之间耦合里有多少来自难度,这一项他们判为不可识别,随探针和口径在 31.8% 到 61.8% 之间浮动。1
这篇里还有一个值得单独记下来的岔子。判官那一档在 112 个批次里有 50 个批次被服务成了没有要求过的模型版本,集中在外语料库上;这件事推翻了作者事先声明好的分析规则,也让审阅结论的评分反转了五个结论。两版他们都照实写了。1

规则挡什么,判官挡什么

第二篇是 Shaswata Mitra、Raj Patel、Subash Neupane、Sudip Mittal、Md Rayhanur Rahman 和 Shahram Rahimi 的《Where Rules End and Judges Begin: Measuring the Judgment Boundary in Multi-Agent Systems Security》,26 页、20 图、24 表。它接着上一问往下走:既然叠层的收益不相乘,那规则和判官各自该管哪一段。3
他们把防御整理成五条原则,实现成一个确定性优先、剩下的交给判断的级联:28 条检查串在一起,能挡的自己挡,挡不了的转给一个由四个判官组成的合议。在四个领域做独立测试后,攻击成功率从大约 30.0% 降到大约 3.0%。3
分工是怎么落的:被挡下来的攻击里 78% 由确定性检查处理,判官只负责剩下的那些;而且在安全运营这个域里,只有四分之一的提案会真的走到判官面前。作者的解释是,违反明确策略的攻击,规则管得住;只是把意图说歪了的,才需要判官来判断。3
他们也点出一个反例:一个按风险评分放行的审批闸门,把大多数攻击提案误放行了,却把少数合法提案拦在外面。这条和第一篇的发现连得上——闸门值多少,要单独测,不能从它自己的分数推出来。3

拿一个已知的正确答案,去测自己的闸门

第三篇换了个行业,问的是检查层里更靠前的一种:准入闸门——统计上得先满足一批条件,一个结论才允许被采纳。标题是《On the Boundary of Admission Gates: An Injected-Truth Study of Falsification-First Selection in Quantitative Strategy Research》,作者 Tianlun Zheng,12 页、3 图、7 表,代码和数据全部公开。场景是量化策略研究:这里的难处不是找出一条赚钱的规则,而是证明这条规则不是运气。4
他的办法是注入真值:往候选池里放进已知的正确答案,再配一个随机准入的对照组,准入率和闸门自己一样高。判据很干脆——只有赢过这个同准入率的随机对照,闸门才算携带了信息,而不只是把门槛抬高了。4
结果分两头。在合成与真实校准的面板上,信号弱的时候,闸门确实消掉了假发现,代价是把准入率压到 1% 到 7%;信号强的时候,它什么也没多带来。4
最刺眼的一条是口径。如果准入条件算在绝对收益上,而不是超额收益上,闸门会静默地拒掉每一个候选,连真信号也一起拒掉。也就是说,同一个闸门,口径写错一个字,它就从筛子变成了墙。4

多挡一层,也要付代价

第四篇问的是反面:检查层加多了会怎样。标题是《ParanoiaEval: Benchmarking Unnecessary Defensive Work in Agentic Coding》,作者 Hanjun Luo、Xiucheng Zhang、Zhuoning Xu、Zhimu Huang、Yingbin Jin、Xinfeng Li 和 Hanan Salam,做的是一个专门测「没必要的防御动作」的基准。5
素材是 200 对仓库级任务,每一对只差一处能决定该不该防御的证据,其余完全一样。他们用软件工程里那套风险处置框架来分类:回避、转移、缓解、接受,四种处置该分开评;再配一套专门量「处置违规」和「对证据的响应度」的指标,判定由一个经过人工校准的 Agent 判官来做。5
八个代表性模型跑下来:在证据已经写得很清楚的情况下,不必要的风险处置发生在 11.2% 到 58.7% 的运行里,换一个配置这个比例就变很多。后两条更要紧——任务能力更强,不代表风险处置更合适;而处置错了,在随后的人工研究里明显伤害了开发者的使用体验。作者据此把风险处置单列成一个独立的能力维度:它不是任务能力的副产品。5

边界

  • 四篇都是作者自报的结果,没有第三方复现。1345
  • 叠层那篇没有会自适应的攻击者,1,119 条动作是静态标注集;判官那一档还出现了模型版本漂移,作者把这个岔子照实写进了论文。1
  • 规则与判官那篇是作者自建的五个原则、四个领域,作者自己也说它是独立测试,不是第三方复现;那个误放行的审批闸门是其中一条被点名的弱点。3
  • 准入闸门那篇用的是合成面板加真实校准面板,作者自己指出它没有测实时交易,也没有跨市场的独立验证。4
  • 过度防御那篇的判定里有一个用模型做的判官,作者用人工研究给它做了校准;任务对是合成的仓库级任务对,不是真实提交历史。5
四篇摆在一起,说的是同一件事:检查层不是越多越安全,它本身是一个要单独测量的东西。
落到动作上是这样。先别假设防线相乘,要量的是整个栈,不是单层——判官之间高度相关,两道叠起来只等于一层多;规则和判官这一对基本一起动,顶不到两层。再分清规则和判官各管哪一段:规则挡违反明确策略的,判官处理把意图说歪的;一次违规要是违反的是一条写清楚的策略,交给判官是在花钱,不是在加安全。然后拿已知真值去测你自己的闸门,配一个同准入率的随机对照,赢不过它,闸门就只是在抬高门槛;口径也要先定死,算超额还是算绝对,能让同一个闸门从筛出真信号变成全部拒掉。过度防御当成成本项来量,多挡一层不免费,它会拦掉合法的动作,也会拖坏用的人。最后一条是工程纪律:把判官用的模型版本钉死,并且记下每一次实际服务的版本——112 个批次里漂了 50 个,足够反转五个结论。
回到开头那句:两道判官叠起来,只等于 1.2 到 1.4 层。你给循环加的那一层检查,到底多挡住了多少,得量出来,不能默认。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content