判官不会说自己没有依据:Agent 循环里证据算不算数

判官不会说自己没有依据:Agent 循环里证据算不算数

同一个模型、同一道题,让它直接判两个版本的代码哪个对,准确率百分之四十三点七。

0:00 / 7:57
同一个模型,同一道题,让它直接判两个版本的代码哪个对,准确率 43.7%。把它拆成三个智能体——一个读题出意见,一个把意见拆成能逐条核对的小问题,一个只看题和解答、逐条去核——准确率掉到 4.4%。这套流程一次错都没报,每一步都成功返回,它只是分不出来。1
这一期取自 9 月 28 日那批新投稿,北京时间 9 月 29 日早上挂出,cs.AI 新投稿 88 篇。其中四篇落在同一个位置上:Agent 循环走到评测和收尾这两步时,判官手里的证据算不算数。2

本期听什么

  • 判官不会报告「我没有依据」。 一套多智能体核查流程在 78%–95% 的对比里判两个解一样好,合起来准确率 4.4%;同一个模型不套这套流程、直接判,准确率 43.7%。1
  • 修法只要一行门控。 把「给两个解提了完全相同问题」的对比挂起来不判,它只回答一半,准确率从 20.7% 回到 36.9%。1
  • 参考答案讲的是流程,不是这一单的答案。 标准的参考基准判官,把 100% 正确的、换过实体的答案判成了错误和幻觉;把检索结果改成范例、按事实三态判定并让判官弃权之后,误罚消掉(0/50),矛盾召回 50/50 与 49/50。3
  • 重复的说法不算独立证据。 按声明的来源类型门控把错误采纳压到 0.06–0.09,其他作答策略是 0.22–0.47;可一个没被质疑过的假信念一旦进了共享记忆,下游消费者在 97%–99% 的探查里都会把它当事实说出来。4
  • 发出去之前,按出处设一道硬线。 出处保真度低于 0.95 就不发共识,改发分歧报告;越到要它拍板的时候,常规的综合越不可靠。5

判官不会报告「我没有依据」

让一个模型判另一个模型写的代码对不对,这个做法在生产里很常见,它有一个准确率看不出来的毛病:没有依据的时候,它不会说不知道,会给一个语气很确定的结论,还跟着一段推理,从外面看和有依据时一模一样。1
作者来自加拿大温莎大学,工作是把一套已发表的多智能体核查流程原样跑在两个判代码的基准上。流程里有三个角色:求解器读题和解答、形成一个判断;提议者把判断拆成一组可以逐条核对的小问题;核对者只看题和解答、看不到求解器的推理,逐条回答。哪一份解答在自己的问题上活下来的更多,哪一份胜出。判官用同一族两个规模的模型,五十四个实验格、约两千次对比。1
两个常见的解释都被排掉了。把题目换简单,直接判的准确率能涨 49 个百分点,这套流程涨不到 1 个百分点;把判官换成参数量 1.75 倍的更大模型,也没有改变结果。1
原因就写在流程自己的日志里,两个量都能直接算出来,不需要标准答案:在 76.6% 的对比里,它给两个解提了完全相同的问题,答案自然分不出差别;被问到的问题里,80.7% 它都答了「是」。
门控也就从这里长出来。既然提一模一样的问题就分不出来,那么在核对之前就能看出来。把这类对比挂起来不判,让流程只回答剩下的:它只回答一半的对比,准确率从 20.7% 回到 36.9%,在每个出题模型、每个难度档、两个判官上都成立。1
论文自己把结论划得很窄:它没打算把判官做得更准,要的是一个能提前看出「这一次没有依据」的检查。而且这套流程照样打不过拆之前的那一个模型——那个模型每次都答,正确率 73.4%。

拿别人的工单去判,正确的答案全被罚了

第二篇来自戴尔科技的三个作者,场景是已经在跑的生产系统:技术支持、IT 运维、财务。用户问的是某一个具体的工单、某一台设备、某一个账户,系统从后端取出事实,再套一套领域流程作答。3
这里的麻烦是结构性的。黄金集存得下问题和流程,存不下实体:两个用户问同一个问题、说的是不同实体,正确答案共用一套流程,几乎每一个表面的值都不同。所以线上真正能拿到的那份最近的参考,几乎总是同一个问题、另一个实体的答案。
论文给这个状态起了名字,叫参考实例分歧。一份参考答案,是一套流程套在它自己的参数上写出来的;线上这个答案,流程应该一样,可编号、日期、状态本来就该不一样。字面比对分不开这两件事,会把它俩的差全算成错误——在那套诊断集上,标准的参考基准判官把 100% 正确的、换过实体的答案判成了错误和幻觉,区分度接近零。256 项、两个判官模型、7872 次判定都支持这个结论。3
提示词也救不了。作者做了一组对照,把线上的事实一起喂给判官、但不改变它对参考的用法,结果一点没动。
要分开,得改三处。检索回来的参考只当范例,讲的是一套流程而不是这一单的答案;答案拆成一条条原子事实,每条只给三种状态——被观察到的事实支持、和事实矛盾、无法验证,只有矛盾才扣分,无法验证只作为覆盖率报出来;最后按检索的置信度决定这一次评不评,检索不到合适的参考就先不评。3
误罚消掉,0/50;该抓的矛盾基本没漏,50/50 与 49/50;区分度从接近零提到 0.58,区间 0.48–0.68。它自己的代价也写得很直白:保护实体取值的那份宽容,会一路放宽到流程上——流程被篡改的那类错误,只抓得到两成;作者试了一个专门补它的补丁,没修好。

三个人说同一句话,也只有一个出处

前两篇的判官都在循环外面。再往里一层,Agent 团队自己就会给自己造证据。4
第三篇问的是共享记忆的准入:一条声称,凭什么可以写进所有 Agent 都能读的那块记忆。难的地方是重复的说法很容易被当成分开的证据——一个 Agent 从记忆里读到一条,转手复述一遍写回去,看上去就多了一个出处。
作者修了一套基准,分两层。静态那层从公开标注语料里拼出来,血统关系写死,所以「三条支持其实来自同一个源」这种情况可以精确算;动态那层让多个 Agent 真的在一块共享存储上跑,每一次写入和读取都记下来,再由一个单独的消费者只根据存储里的内容答题。4
八种准入策略一起测,结果两头都不好受:会去重出处的策略把很多真声称也一起拒了,在每一族上拒真声称都比拒假声称更狠;而保住答案覆盖率的策略,放假的进来和不设限差不多。
两头都还行的只有一个:按声明的来源类型门控——声明为权威来源、又不和已知的事实冲突才准入,有没解决的冲突就搁置,其余交给别处。它把错误采纳压到 0.06–0.09,其他作答策略是 0.22–0.47。代价是它只在场景能提供那个权威来源类型的时候才最强:在混合场景里它的正确率是零。4
更该记住的是后面那句:一个没被质疑过的假信念一旦进到共享记忆,在四种模型族上,下游的消费者在 97%–99% 的探查里都会把它当事实说出来。作者也认了天花板:所有非预言机的策略,都没能在「逐字照抄、换个说法、换说法并声明为权威」这三种形态上同时稳住——光有来源类型还不够,得看得见血统。

一句流利的共识,可能一个出处都没有

最后一个位置在最末端:多智能体讨论完了,写那份结论的时候。5
论文来自华沙理工大学,研究多智能体辩论的收尾。一直以来的假设是,讨论得够深、日志留得够全,最后那次综合就会老实压缩;他们认为这里有个结构性盲区。原因很直白:综合节点被优化的是连贯。两边真的没谈拢的时候,它会把没解决的分歧溶解成抽象、修辞上的重叠、或者更软的说法,读起来像达成了共识。5
做法是把出处从日志改成闸门。先定一个指标,出处保真度:最终稿里每一句,有多少能被辩论日志里的原话严格蕴含。再设一条硬线 0.95——过不去就不准发,系统带着提示再综合一次,最多三次;三次还过不去就不发共识,改发一份分歧报告,把对立的立场和缺失的证据列出来。5
效果分两半。自愈那一半有用:在冲突最重的场景里,它把平均出处保真度抬了一倍以上;九十个对抗性运行支撑这一条。闸门那一半更值得听:冲突越重,过不了线的最终稿越多——低冲突场景里六成,严重零和僵局里七成半。越到要它拍板的时候,常规的综合越不可靠。5
配置上还有个坑:让同一个模型既生成又审核,那些结构上不安全的折中,有 85.6% 会被放行;换成生成和审核用不同档位的模型,六成三就发不出来了。人的反应也跟预期一致:66.7% 的受试者觉得编出来的那版共识更流畅、更圆滑,可在高风险场景里,75.8% 的人认得出过了闸门的那版更贴证据,也更愿意收到一份明写着「没谈拢」的报告。

边界

四篇都是作者自报的结果,没有第三方复现。1345
  • 判官那篇跑的是学术基准,判官本身是参数量八倍和十四倍那一级的本地模型;它给出的门控是部分修复,不是解法。
  • 参考基准那篇的基准集是构造出来的,换实体这类情形是人工注入的,不来自真实工单流量;作者自己指出,那份宽容会顺带放过流程类的错误。
  • 共享记忆那篇的静态集来自公开标注语料,动态集里的血统是场景写死的,不是从文本相似度推出来的;候选与检索记录之间的对应关系只能靠 Agent 自己声明,声明不全会限制结论。
  • 综合那篇是合成的危机模拟,冲击是硬编码的,出处只在一个封闭的证据世界(聚合起来的辩论语料)里成立,不对照外部现实;人工研究只有 33 人,且没有区分领域专家和众包参与者。
还有一条更根本的:这四套办法都在回答同一句话——这条说法有没有出处。它们回答不了另一句:这条说法本身对不对。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content