改坏一条边,零误动作的闸门就漏了:Agent 动手之前,许可该由什么给

改坏一条边,零误动作的闸门就漏了:Agent 动手之前,许可该由什么给

有人只改了一张图上的一条边,一行代码都没动。

0:00 / 6:59
同一个报出零误动作的因果动作检查器,被改掉自己那张动作与状态图上的一条边之后,误动作从零涨到 15.3%;这些被执行的动作里 91% 是有害的,效用从 +2.27 掉到 +0.35。要命的是,它们每一个都带着一份内部完全成立的合格证——证书证明的是「在这张图的假设下,这次干预可识别」,证明不了这张图是对的。1
这一期取自 9 月 30 日提交、北京时间 10 月 2 日早上挂出的那批新投稿,cs.AI 新投稿 133 篇。其中四篇落在同一个位置上:Agent 走到要动手的那一步,许可该由什么给。2

本期听什么

  • 合格证成立,不等于那张图是对的。 漏掉一条双向边,误动作就到 15.3%,其中 91% 有害;把一条箭头反向,误动作 48.9%、正确执行 0 次。加一道有界随机抽检能把两种攻击都抓出来,代价是公布强度下 97.1% 的有益动作照样不执行。1
  • 高分不能给一次动作授权。 在 280 个构造算例里,一条只看分数的规则放过了「必须拦下」的 100 个动作中的 80 个,以及全部 40 个「必须送人工复核」的动作;作者还证了一条代数结论:阈值只要高于最小权重,分数规则就会与闸门合取分道扬镳。3
  • 该维护的是一个状态,不是一串触发器。 把充分性、可靠性、冲突、不确定性、证据缺口、获取成本写成一个显式状态,再由它选动作:同一个开源底座上 token F1 0.572、每题 3.89k token,比固定迭代检索高,还少用 39% 的 token。4
  • 检查的预算,该跟着影响走。 只跑 50 个试次(整个语料的 6%),风险感知的分配就能找回预言机按影响加权能找回的 86% 的失败,均匀分配是 25%;同样试次下高影响失败多 3.5 倍(215.4 对 62.2),每美元发现量 5 倍。5
  • 四篇问的是同一句话。 闸门自己的依据能不能被查、许可能不能由总分给、判断建立在一堆触发器还是一个状态上、检查的钱花在哪——都是「这次动作凭什么放行」。

合格证成立,不等于那张图是对的

先说清这类检查器的工作方式。Agent 每次要调用一个会改状态的工具(下单、改配置、发一封邮件),检查器先拿一张已经提交好的「动作—状态图」判断:这次干预在这张图上是不是可识别。判断通过,就发一张合格证,上面带着识别论证和一个单侧的置信下界。被红队的那个检查器,在一个带混杂的工具调用基准上报出的误动作是零。1
作者 Fabio Rovai 来自伦敦的 The Tesseract Academy,他没有去改检查器的代码,只改那张被提交的图。删掉一条双向边,误动作从零变成 15.3%——这是基准自己公布的混杂强度下的数字。这些被执行的动作里,91% 是有害的,效用从 +2.27 掉到 +0.35。1
第二种改法更极端:把一条箭头的方向反过来,让本来在中间传话的变量被当成混杂因素来对待。误动作变成 48.9%,正确的执行一次都没有。1
关键在下一句:这些动作,每一个都带着一份内部成立的合格证。证书证的是「在我这张图的假设下,这次干预可识别」;它没有、也无法证明这张图本身是对的。图是整个判断的地基,而地基不在证书的担保范围里。1
作者的补法是一道抽检:凡是过了离线认证的动作,再拿一个有界的随机样本实测一次;测不过的、或者根本没法测的,一概拒掉。两种攻击都被抓出来了,代价是在一张正确的图上,555 次执行里有 2 次误报。1
它买不回的东西也写得很直白:在基准公布的混杂强度下,97.1% 的有益动作依然不会被执行。挡下它们的不是抽检,而是那张被改坏的图——这些动作在抽检之前就已经被拒了。作者把账算出来:每 1,050 个动作,把安全性买回来要 127 次实验,把丢掉的价值买回来还要再花 614 次;都补齐之后,这套带审计的检查器才在每一个例子上做出和那张正确图一样的决定。1
作者划的边界同样重要:基准是合成的;攻击是直接改图、本身没有成本模型,衡量的是「图被改坏会造成多大伤害」,不是「改坏一张图有多难」;抽检还假设一个便宜的随机样本拿得到——而真正最需要把关的不可逆动作(付款、发药),恰恰是最没法做随机抽检的;抽检那一步也不带校准过的误差保证。1

总分不能给一次动作授权

第二篇把问题往上抬一层:许可这件事,制度上该怎么写。作者 Serhii Zabolotnii 的隶属包括乌克兰切尔卡瑟商学院、乌克兰武器装备试验与认证科研所以及纽约的 healthPrecision。他把当前的空档叫「保证转移的空档」:基准、审计、Agent 协议都在讲性能、权限和修复,却没有讲观察到的证据该怎么改变一个 Agent 在执行任务时的权限。3
他提出的东西叫运行时保证契约,把六件事绑进同一份策略级的约定:自治边界、组件资格、证据状态、状态转移规则、人工复核容量,以及一组非补偿性的闸门。非补偿性是重点:软性指标可以用来做路由,但一旦某道必过的闸门失败、或者状态未知,就只能重试、换件、升级、推迟或者停——别处的分数再高也补不了这个洞,总体的成绩不能给一次具体的动作授权。3
契约给了五条不变量,最实用的三条是:学习出来的组件不能给一次有后果的动作授权,也不能改自己的自治边界;失败或状态未知的必过闸门,一律按不放行处理;置信度是不对称的,低置信可以收紧权限,高置信不能免掉独立检查。3
然后是那个失败注入实验。280 个构造出来的算例里,按论文给的示例权重和阈值,一条只看分数的规则放过了「必须拦下」的 100 个动作里的 80 个,以及 40 个「必须送人工复核」动作中的全部。作者还证了一条代数结论:只有当阈值不超过最小的那个权重,这两套规则才完全一致——阈值往上调一格,分数就开始吃掉闸门。另有 18 条手写轨迹用来检查版本化的证据与复核转移;在一个 24 段的前瞻性合成留出集里,两个盲评的模型判官对全部 72 次动作尝试给出的标签完全一致,这套契约与一个单独实现的完整状态基线都对上了。3
作者自己的限定最该记住:这是一份策略级的规范,是合成机制上的实验,不构成部署保证,也不是一个新的信任分数。3

该维护的是一个状态,不是一串触发器

第三篇换到更靠前的位置:做判断的时候,拿什么当依据。自适应检索这类循环用置信度、相关性、支持度、检索质量这些信号,决定什么时候该再搜一次、什么时候该更换证据;问题是这些信号平时都是一根根独立的触发器,一趟多步检索走下来,很难维持一个前后一致的判断。作者把它叫证据状态碎裂。4
做法是维护一个显式的状态,里面是六个量:证据够不够、可不可靠、有没有冲突、有多不确定、缺口在哪、再拿一次证据要花多少。再由这个状态去选下一个动作:检索、改写查询、核对、作答、停止,或者拒答。4
数字是这么一组:在六个问答基准上、用同一个开源底座,平均 token F1 是 0.572,每题 3.89k token;固定的迭代检索是 0.555,还要多花 39% 的 token。换一个底座模型,模式一样:0.552 对 0.523,token 少 35%。4
更能说明问题的是消融:涨分主要来自纠正性的重新检索——发现证据不对就换掉,而不是把上下文剪短;六个量里有些是冗余的,真正起作用的是「这一次能不能答」这个经过校准的判断。作者也提醒,校准能提高阈值在相近来源之间的稳定性,可证据来源一换,同一套阈值和信号就可能失效。4
边界:检索仍是词法的;每个数据集只测了 100 道题;校准与底座模型绑得很紧;辅助指标还是自评的。4

检查的预算,该跟着影响走

最后一篇回到同一套检查的另一头:这些检查要花的钱该怎么花。两位作者 Priyanath Maji 与 Spandan Ghose Chowdhury 都在佐治亚理工,他们把评测写成一个顺序分配问题:试次预算固定,要决定在哪些场景上跑、哪些再跑一遍。现在通行的做法是一视同仁——一次只读查询和一次不可逆的付款动作,被抽到的次数一样多。5
他们的做法是把场景的上下文、一个固定的影响分,以及评测过程中已经观察到的失败结果合起来,排一个风险感知的采样顺序。数据是航空订票场景基准里的 70 个场景和 824 条已录制的试次,用离线回放来测。5
最主要的数字在预算最小那一档:只有 50 个试次,也就是整个语料的 6%,它找回了预言机按影响加权能找回的 86% 的失败,均匀分配是 25%;同样的试次数,找出的高影响失败是 3.5 倍(215.4 对 62.2),每美元发现量是 5 倍,花在从来不会失败的场景上的预算从 34% 降到 2.8%。5
优势的边界也写清楚了:预算涨到接近整个语料大小时优势消失;场景上下文主要在小预算上有用,中等预算靠的是后验探索。剩下的限制是:只有一个领域;影响分是规则给的固定值,无法从轨迹里推断一次失败有多严重;把每个场景当成互相独立的臂,忽略了场景之间的相关性;它优化的目标是「找到失败」,不是「把可靠性估准」——作者自己提醒,要一个无偏的可靠性估计,均匀覆盖仍然不可替代。5

边界

  • 四篇都是作者自报的结果,没有第三方复现。1345
  • 红队那篇的基准是合成的,攻击直接改图、没有攻击者能力与预算模型,也不评估真实工具 Agent 基准,测的是「图被改坏会造成多大伤害」。1
  • 契约那篇是策略级的 schema 与合成机制研究,论文自己声明不构成部署保证,跨领域的探测只是示例、没有性能测量。3
  • 状态那篇每个数据集只有 100 道题,检索是词法的,校准绑在特定底座上,自评指标。4
  • 预算那篇只在一个领域做过离线回放;影响分是规则给的,本身编码了「哪些失败算数」的价值判断,而把预算集中到高影响场景会欠采样其余场景。5
还有一个这几篇都没回答的问题:如果「哪个动作更值得拦」这件事本身就写死在规则里,这套许可机制执行的仍然是人的价值判断,而不是替人做判断。
回到开头那个零。从零误动作到 15.3% 之间那一截,缺的不是一个更强的模型,是一个能被质疑的假设。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content