改坏一条边,零误动作的闸门就漏了:Agent 动手之前,许可该由什么给Chapters有人只改了一张图上的一条边,一行代码都没动。0:01合格证成立,不等于那张图是对的1:54总分不能给一次动作授权3:19该维护的是一个状态,不是一串触发器4:24检查的预算,该跟着影响走5:46这四步问的是同一句话0:00 / 6:591×0:01探针有人只改了一张图上的一条边,一行代码都没动。0:04探针那个专门拦危险动作、报出零误动作的检查器,马上开始放行:误动作涨到百分之十五点三。0:11探针被放过去的每一个动作,都带着一份内部完全成立的合格证。0:16探针这里是 AI Loop Engineering。0:18探针我是探针,这一期由我来播。0:21探针今天是十月二号,周五。这一期用的是今天早上刚挂出来的新一批预印本,新投稿一百三十三篇。0:30探针四篇落在同一个位置上:Agent 走到要动手的那一步,许可该由什么给。0:36探针第一篇的作者在伦敦,他把一个已经发表的因果动作检查器拿去打了红队。0:42探针这类检查器在 Agent 调用会改状态的工具之前,先拿一张提交好的动作与状态图判断这次干预可不可识别;过了就发一张合格证。0:51探针删掉一条双向边,误动作从零变成百分之十五点三;被打出去的动作里,九成一有害,效用从正的二点二七掉到零点三五。1:01探针把一条箭头的方向反过来,让本来在中间传话的变量被当成混杂因素:误动作百分之四十八点九,做对的次数是零。1:09探针要命的是下一句:每个被放过去的动作,都带着一份内部成立的合格证。合格证证明的是「在这张图的假设下,这次干预可识别」,它没有、也没法证明这张图是对的。1:21探针补法是加一道抽检:过了离线认证的动作,再拿一个有界的随机样本实测一次;过不了的、或者根本没法测的,一概拒掉。两个攻击都抓出来了;在一张正确的图上,五百五十五次执行里只误报两次。1:36探针代价很直白:在基准公布的混杂强度下,九成七点一的有益动作照样不会被执行——挡它们的不是抽检,是那张图在抽检之前就已经把它们拒了。1:45探针边界:基准是合成的,攻击是直接改图、没有成本,抽检还默认样本便宜——而最需要把关的不可逆动作,恰恰最没法抽检。1:54探针第二篇把这件事往上抬一层:许可这件事,制度上该怎么写。1:59探针作者在乌克兰的切尔卡瑟。他说这一层是空的:基准、审计和协议都在讲性能、权限和修复,没讲观察到的证据该怎么改变一个 Agent 的权限——他管这个空档叫保证转移的空档。2:13探针他提的东西叫运行时保证契约,把自治边界、组件资格、证据状态、状态转移规则、人工复核容量,还有一组非补偿性的闸门,绑进同一份约定。2:25探针非补偿性是关键。软性指标可以做路由;可某道必过的闸门一失败、或者状态未知,就只能重试、换件、升级、推迟,或者停。别处分数再高也补不了这个洞——总体的成绩不能给一次具体的动作授权。2:41探针五条不变量里最实用的三条:学习出来的组件不能给一次有后果的动作授权;失败或状态未知的必过闸门一律不放行;置信度是不对称的,高置信也不能免掉独立检查。2:56探针那个失败注入实验,数字比结论还扎眼:两百八十个构造出来的算例里,一条只看分数的规则,放过了必须拦下的一百个动作里的八十个。3:06探针他还证了一条代数结论:阈值只要超过最小的那个权重,分数规则就开始吃掉闸门。3:12探针作者自己划的线最该记住:这是合成机制上的实验,不是部署保证,也不是一个新的信任分数。3:19探针第三篇换到更靠前的位置:做判断的时候,拿什么当依据。3:23探针自适应检索这类循环,用置信度、相关性、支持度这些信号决定什么时候再搜一次;可它们平时都是一根根独立的触发器,一趟多步检索走下来很难维持一致的判断——作者把这叫证据状态碎裂。3:39探针他的做法是维护一个显式状态,里面六个量:证据够不够、可不可靠、有没有冲突、有多不确定、缺口在哪、再拿一次要花多少;再由这个状态来选动作:检索、改写、核对、作答、停止,或者拒答。3:52探针六个问答基准、同一个底座模型上,平均的 token F1 是零点五七二,每道题三千八百九十 token;固定的迭代检索是零点五五五,还多花百分之三十九的 token。4:04探针更值得看的是消融:涨分主要来自纠正性的重新检索——发现证据不对就换掉,而不是把上下文剪短;真正起作用的是「这一次能不能答」这个校准过的判断。4:14探针边界:检索还是词法的;每个数据集只测了一百道题;校准绑在底座上;还有一个坑——证据来源一换,同一套阈值和信号就可能失效。4:24探针最后一篇回到这套检查的另一头:这些检查要花的钱,该怎么花。4:30探针两位作者在佐治亚理工。他们把评测写成一个顺序分配的问题:试次预算固定,要决定在哪些场景上跑、哪些再跑一遍。4:39探针通行的做法是一视同仁:一次只读的查询,和一次不可逆的付款动作,被抽到的次数一样多。4:45探针他们的做法,是把场景的上下文、一个固定的影响分,和评测里已经观察到的失败合起来,排一个风险感知的采样顺序;数据是航空订票场景基准里的七十个场景、八百二十四条已录好的试次,离线回放。5:01探针最主要的数字在预算最小那一档:只有五十个试次,整个语料的百分之六,它找回了预言机按影响加权能找回的失败的百分之八十六;一视同仁是百分之二十五。5:13探针同样的试次,它找出的高影响失败是三点五倍,每一块钱找出来的失败是五倍;花在从不失败的场景上的预算从百分之三十四降到百分之二点八。5:24探针论文给自己划的边界很清楚:预算涨到接近整个语料,优势就没了;场景上下文主要在小预算上有用。5:32探针边界还有一串:只有一个领域;影响分是规则给的固定值;每个场景被当成互相独立的臂,忽略了相关性;而且它优化的是「找到失败」,不是「把可靠性估准」——要一个无偏的估计,均匀覆盖仍然不可替代。5:46探针把这四个位置摆在一起,问的是同一句话:Agent 要动手的那一步,许可凭什么给。5:51探针许可不能由总分给;判断该建立在一个显式状态上,而不是一串触发器;闸门自己的依据要能被查——合格证只证明它在假设里成立,不证明假设成立;检查的预算该跟着影响走,而按影响分配,本来就不适合用来估准可靠性。6:06探针边界再说一次:四篇都是作者自报的结果,没有第三方复现。第一篇的平台是合成的;第二篇是构造出来的失败注入,作者自己说没有部署保证;第三篇每个数据集只测一百道题;第四篇只在一个领域回放过。6:22探针还有一个这几篇都没回答的问题:如果「哪个动作更值得拦」本身是人写进去的,那这套许可机制执行的仍然是人的价值判断,不是替人做判断。6:32探针回到开头那个零。从零误动作到百分之十五点三之间那一截,缺的不是一个更强的模型,是一个能被质疑的假设。6:40探针我们下期见。