判官不会说自己没有依据:Agent 循环里证据算不算数Chapters同一个模型、同一道题,让它直接判两个版本的代码哪个对,准确率百分之四十三点七。0:01拆成三个智能体,判官反而判不出来了0:41判官不会报告「我没有依据」2:06拿别人的工单去判,正确的答案全被罚了3:41三个人说同一句话,也只有一个出处5:05一句流利的共识,可能一个出处都没有6:33这四步问的是同一句话0:00 / 7:571×0:01主播同一个模型、同一道题,让它直接判两个版本的代码哪个对,准确率百分之四十三点七。0:08主播把它拆成三个智能体,一个人出意见,一个人拆成能逐条核对的小问题,一个人只看题和解去核,准确率掉到百分之四点四。0:18主播这套流程一次错都没报,每一步都成功返回,它只是分不出来。0:23主播这里是 AI Loop Engineering。0:25主播今天是九月二十九号,周二。这一期用的是新一批预印本,北京时间今天早上刚挂出来。0:34主播其中有四篇撞在同一个位置上:循环走到评测和收尾那两步时,判官手里的证据算不算数。0:41主播第一篇论文盯的就是那个准确率看不出来的毛病。0:45主播它没有依据时不会说不知道,会给一个语气很确定的结论加一段推理,从外面看和有依据时一模一样。0:55主播作者来自加拿大温莎大学。他们拿一套已发表的多智能体核查流程,不加修改地跑了两个判代码的基准,五十四个实验格、约两千次对比。1:07主播在百分之七十八到九十五的对比里,它判两个解一样好,合起来准确率百分之四点四。1:14主播两个常见解释都排掉了:题目换简单,直接判能涨四十九个百分点,这套流程涨不到一个点;换个参数量一点七五倍的更大判官,也没变。1:26主播原因藏在流程自己的日志里,两个量就能算出来:百分之七十六点六的对比里,它给两个解提了完全相同的问题;被问到的问题里,八成零七它都答了「是」。1:40主播修法顺着就下来了:既然提一样的问题就分不出来,那在核对之前就能看出来。把这些对比挂起来不判,它只回答一半,准确率从百分之二十点七回到三十六点九。1:52主播论文没打算把判官做得更准,它要的是一个能提前看出「这一次没有依据」的检查。它也没解决全部问题:这套流程照样打不过拆之前的那一个模型,正确率百分之七十三点四。2:06主播上一段里判官核对的是证据;被拿去当标准的那份参考答案自己出了问题。2:12主播论文来自戴尔科技,场景是已经在跑的生产系统,用户问的是某一个具体的工单或账户。2:21主播麻烦是结构性的:黄金集存得下问题和流程,存不下实体,所以线上那份最近的参考,几乎总是同一个问题、另一个实体的答案。2:32主播论文把它叫做参考实例分歧:参考答案是一套流程套在它自己参数上写出来的,线上这个答案流程该一样,可编号、日期、状态本来就该不一样。2:45主播字面比对分不开这两件事,会把它俩的差全算成错误:标准判官把百分之百正确的、换过实体的答案判成了错误和幻觉。提示词也救不了——把线上的事实一起喂进去、但不改变判官对参考的用法,结果一点没动。3:03主播要分开得改三处:检索回来的参考只当范例,讲的是一套流程;答案拆成一条条原子事实,每条只给三种状态,支持、矛盾、无法验证,只有矛盾才扣分;最后按检索的置信度决定这一次评不评。3:22主播误罚消掉,零比五十;该抓的矛盾基本没漏,五十次里五十次和四十九次;区分度从接近零提到零点五八。3:32主播代价也写得很直白:保护实体取值的那份宽容会一路放宽到流程上,流程被篡改的错误只抓得到两成。3:41主播再往里一层,Agent 团队自己就会给自己造证据。3:45主播这篇论文问的是共享记忆的准入:一条声称,凭什么可以写进所有 Agent 都能读的那块记忆。3:53主播难的地方是重复的说法很容易被当成分开的证据:一个 Agent 从记忆读到一条,转手复述一遍写回去,看上去就多了一个出处。4:04主播作者修了一套基准,分两层:静态那层从公开标注语料拼出来,血统写死,所以「三条支持来自同一个源」能精确算;动态那层让多个 Agent 真在共享存储上跑。4:18主播八种准入策略一起测:能去重出处的把很多真声称也一起拒了;而保住答案覆盖率的,放假的进来和不设限差不多。4:27主播两头都还行的只有一个,按声明的来源类型门控,声明为权威来源、又不和已知事实冲突才准入——它把错误采纳压到零点零六到零点零九,其他作答策略是零点二二到零点四七。4:44主播更该记住的是后面那句:一个没被质疑过的假信念一旦进了共享记忆,在四种模型族上,下游消费者在百分之九十七到九十九的探查里都会把它当事实说出来。4:55主播光有来源类型还不够,所有非预言机的策略都没能在逐字照抄、换个说法、声明为权威这三种形态上稳住,得看得见血统。5:05主播最后一个位置在最末端:讨论完了,写那份结论的时候。5:10主播论文来自华沙理工大学,研究多智能体辩论的收尾。通常假设讨论得够深、日志留得够全,最后那次综合就会老实压缩——他们认为这里有结构性盲区。5:22主播原因很直白:综合节点被优化的是连贯。两边真没谈拢的时候,它会把没解决的分歧溶解成更软的说法,读起来像共识。5:32主播他们的做法是把出处从日志改成闸门:先定一个指标叫出处保真度,最终稿里每一句有多少能被辩论日志的原话严格蕴含,再设硬线零点九五。5:44主播过不去就不准发。系统带着提示再综合一次,最多三次;还过不去就不发共识,改发一份分歧报告,列出对立的立场和缺失的证据。5:56主播自愈那一半有用:冲突最重的场景里,它把平均出处保真度抬了一倍以上。闸门那一半更值得听:冲突越重,过不了线的最终稿越多,低冲突场景里六成,零和僵局里七成半。6:11主播配置上还有个坑:让同一个模型既生成又审核,结构上不安全的折中有百分之八十五点六会被放行;换成两个档位的模型,六成三就发不出来。6:23主播人的反应跟预期一样:六成七的受试者觉得编出来的那版共识更流畅,可在高风险场景里,七成六的人认得出过了闸门的那版更贴证据。6:33主播把四个位置摆在一起,问的是同一句话:这条结论有没有出处。6:38主播判官说的话要能追到证据上:证据得独立于它审的那个答案,还得能在两个候选之间分出差别;分不出来的时候,挂起来不判,比硬给一个结论便宜。参考基准管的是流程,实体的值本来就该不同。共享记忆里,重复不算独立出处。综合发出去之前,用出处设一道硬线。7:02主播边界说在前面:这四篇都是作者自报的结果,没有第三方复现。判官那篇跑的是学术基准;参考基准那篇的诊断集是构造出来的;共享记忆那篇的血统是场景写死的;综合那篇是合成的危机模拟,出处只在一个封闭的证据世界里成立。7:20主播还有一条更根本的:这四套办法都在回答有没有出处,回答不了这条说法本身对不对。7:26主播回到开头那个数字。百分之四十三点七和百分之四点四之间那一截,来自一个没被留出来的出口:这套流程不会说「我不知道」。7:38主播我们下期见。