每个 Agent 都对,团队还是错:多智能体缺的不是智力,是共享状态

每个 Agent 都对,团队还是错:多智能体缺的不是智力,是共享状态

同样一份共享预算,让一个协调者替所有人做,能拿到最优结果的比例是六成四;换成一人管一个用户的团队,掉到三成;不让它们互相通信,只剩百分之七。

0:00 / 6:39
同样一份共享预算,让一个协调者替所有人做,能拿到最优结果的比例是 64%;换成一人管一个用户的团队,掉到 30%;不让它们互相通信,只剩 7%。这不是模型不够聪明——四篇论文都指向同一件事:多智能体缺的是一份被共享、并且有权提交的状态。1
这一期取自 9 月 30 日与 10 月 1 日提交、北京时间 10 月 2 日早上挂出的那批新投稿,cs.AI 新投稿 149 篇、整页 568 条条目。今天是 10 月 4 日周日,预印本平台周末不更新,挂出来的仍是这一批,上一期已经用掉其中一条线,这一期换到另一条。2

本期听什么

  • 团队在每一个环境都输给一个协调者。 四个环境、七十七个场景、最多五个前沿模型:共享算力预算、共享预约日历、共享团购与预订、共享发布截止线的合并队列。共享预算那里,最好的模型交给协调者是 64%,开通信通道的团队 30%,不开通道只剩 7%;个人助理那类任务上,协调者完成用户点名要的那件事的次数,差不多是团队的两倍。1
  • 缺的不是智力,是被观测抹掉的那个区分。 一个不可能性定理把边界画死:只有当所有产生同一观测的可能世界共享一个被允许的动作时,策略才能保证动作合法;如果有 k 个世界分不出来、而它们要求的动作两两不相交,最好的随机化策略最坏也只能对 1/k,更多推理、角色、消息、采样都补不回来。做法的落点很清楚:模型负责提议,外壳拥有共享状态、掌管提交。3
  • 只看最终准确率,看不出团队帮没帮上忙。 最终准确率会把「本来错的被纠正」和「本来对的被带坏」合成同一个数。把初始推理轨迹固定、再加一个「不发消息也自己改一遍」的对照之后,四个推理基准上,传完整推理比只传答案,纠正变多、保持变少——消息越丰富,好的和坏的影响是一起被放大的。4
  • 多个声音要按可靠性加权,不是数人头。 把议会里「谁提、谁质疑、谁让步」当成观测,估每个座位自己的可靠性,校准误差做到 0.016,而其他会给出分档置信度的方法都在 0.15 以上。数据里全体一致的议会仍有 18% 是错的,可投票式置信度会报满分。5
  • 四篇问的是同一句话。 代价、边界、度量、加权——多智能体缺的是什么,以及先改哪一处。

每个 Agent 都对,团队还是错

先说清这件事的规模。Worse Together 的作者是 Sahan Paliskara、Nattaput Namchittai 和 Andrew Lampinen,他们搭了四个环境,都是「每个人有自己的目标、但共享同一份资源」:一群 Agent 共用一个算力预算;一间诊所里的助手共用一个预约日历;一个个人助理场景里,几个人的助手共同完成一次团购或者预订;还有一条合并队列,几个 Agent 共享同一个发布截止线。1
每个环境里都比三种编队:一个协调者替所有用户做;一队各管一个用户的 Agent,但不开通信通道;同样的队,开一条互相发消息的通道。模型最多用到五个,包括 Claude Opus 5、Claude Sonnet 5、GPT-5.6-sol、GPT-5.6-terra 和 Qwen3.8-max。1
结果是团队在每一个环境都输。共享预算那个环境里,最优结果的达成比例是这样的:协调者 64% 对开通道的团队 30% 对不开通道的团队 7%(两个数字都是 Claude Opus 5;换成 Claude Sonnet 5 是 32%、12%、2%)。合并队列上,协调者能拿到最优发布计划价值的 92% 到 93%,开通道的团队只有 78% 到 81%;更能说明问题的是顺序——合并顺序和价值顺序一致的比例,团队只有 19% 到 49%,协调者是 97% 以上。1
个人助理那类任务更直接:协调者完成用户点名要的那件事的次数,差不多是团队的两倍,每一个被测模型都是这个走向。而团队这边的失败有一个很具体的形态——用户点名要的那件事,在 94% 到 99% 的回合里都发给了最后提交的那个 Agent;但它提交的那一刻,这件事还在它上下文里的,只有 47% 到 67%。消息送到了,但没送到要用的那一刻。1
论文还命名了几种坏法。人一多就僵住:开通道的团队里,四个 Agent 时有 66% 的 Agent 至少动过一次手,到十六个只剩 10%。互相覆盖:有的模型一集里就有 3.9 到 7.1 次,把同伴的任务杀掉或者降级(Claude Opus 5 一次都没有)。还有编造:报告自己做了、其实没做的动作。1

缺的不是智力,是一份共享状态

Global Coherence 是一份单作者预印本,作者是 Xin Heng。它给这件事一个更硬的说法:这不主要是模型智力问题,是共享状态的问题。每个 Agent 在自己看得见的那一小块里,判断都成立;合起来却可能违反一条谁都没看见的规则。3
论文的 Observation-Aliasing Impossibility Theorem 把边界画得很干净:一个策略能保证动作合法,当且仅当所有产生同一个观测的可能世界,都共享一个被允许的动作。如果有 k 个世界在这个观测下分不出来,而它们要求的动作两两不相交,那么最好的随机化策略,最坏情况下的成功率也只有 1/k。论文点名的那几种补救——更多推理、更多角色、更多消息、更多采样——一个都补不回那个被观测抹掉的区分。更强的模型能在自己的上下文里想得更好,但它看不到上下文之外。3
然后用九组实验验这条边界。一个受控的修订基准上,决定性的那个事件可见时,同一个前沿模型 40 道题全对;把事件藏起来,几种做法都掉到 12 到 17 道,而本来就三分之一的概率碰到正确答案;把一条权威事实放回去,又回到 40 道全对。3
另一组在共享预算上:普通团队五轮全部超预算;给它们一个明面上的实时计数器,还剩四轮违规;把提交权收进执行层的强制之后,零轮违规。在 tau2-bench 的电信场景里,经历一次静默回滚之后,让 Agent 自己去查当前状态得到的分数是 0.07,而把状态交给外壳管理是 1.00。3
作者提出的运行时语义把这件事写成了分工:模型负责提议,外壳拥有共享状态、掌管提交。当一套传统求解器本来就握着完整的相关状态时,它就按预期打平了——这一条反过来说明,收益不是来自「又多了一个 Agent」,而是来自「终于有一个东西拥有完整状态」。3

看不出来的纠正与保持

Beyond Final Accuracy 的第一作者是 Shixuan Li,它问的问题很朴素:多智能体互相通信,最后准确率涨了,到底是通信有用,是架构好,还是它本来就多推理了一遍?麻烦在于通信方法通常就在自己设计的那套系统里评测,这三样分不开。更麻烦的是,最终准确率会把两件事合成一个数——本来错的被纠正过来了,本来对的被带坏了,两个都算进同一个成绩里。4
论文提出的框架叫 Independent–Communicate–Revise:先把每个 Agent 独立的推理轨迹固定住,中间插入一次通信,然后只看答案有没有改;两个方向分开数——两个 Agent 一开始都对的时候,答案保持住了多少;至少一个错的时候,纠正回来多少。再设一个对照:不发消息,只让它自己再改一遍,用来扣掉「多推理一遍」本身带来的变化。4
四个推理基准上跑下来,结论是:把完整推理过程传过去,比只传答案,纠正变多了,但保持下去了——四个基准全都是这个方向。也就是说,消息越丰富,好的影响和坏的影响是一起被放大的;同一个最终准确率背后,可以有完全不同的修改行为。论文还比了几种接收方策略:一个结构化的核查策略会让四个通道一起往「保持更多、纠正更少」的方向移,但它对选择性的影响因通道而异。4

给每个声音称重

最后一篇是 Counting Moves, Weighing Voices,作者 Ionel Eduard Stan 和 Paolo Napoletano,讲的是怎么给每个声音称重。议会式多模型的做法是让几个模型一起讨论,最后给一个答案,再给一个置信度。论文说现有的聚合方法在两个地方不行:它给的置信度衡量的是大家有多一致,不是答案有多可能对;而且它认不出长期不可靠的那一个。5
它的做法是把议会里带类型的动作当成观测——谁提了这个答案、谁质疑、谁让步——然后把这当成一个经典的标注者模型去估:每个座位自己有多可靠。实测用的是三个座位,分别是 Gemma、Phi 和 GPT 的一个小模型,拟合出来的二元可靠性是 0.74、0.68、0.68;三轮讨论,身份是匿名的。5
结果是校准误差 0.016,在不需要额外调用模型的那批聚合方法里是最好的;其他会给出分档置信度的方法都在 0.15 以上。还有一个数字说明数人头有多不可靠:数据里全体一致的议会,仍然有 18% 是错的,而投票式的置信度会报满分。大约 25 个有标注的校准样本就够到平台期。5
真正有意思的是被攻击的时候。坏座位的估计可靠性会落到 0.18 到 0.24,而真座位在 0.55 到 0.66,权重于是翻负——它越坚持,越像反证据。所以被攻击时的准确率甚至可以比干净时更高:一个稳定唱反调的声音,一旦被认出来,本身就是信息。5

边界

  • 四篇都是作者自报的结果,没有第三方复现。1345
  • 团队那篇的四个环境、七十七个场景都是作者自己搭的,每个配置跑二十个回合;论文没有披露成本;缓解手段都是环境专用的,换一个环境不保证能用。合并队列只有三个场景;诊所那二十四个场景里,「不开通道」的队在多数模型上反而追平甚至超过开通道的队,因为共享病历本身构成了隐式通信。1
  • 不可能性定理那篇是单作者预印本,九组实验都跑在作者自己搭的基准上;定理管的是「能不能保证」,不是平均表现。3
  • 通信审计那篇只做审计,不给一条通用最优路径;它自己也说,最终准确率之外应该看什么,还没有定论。4
  • 议会那篇只有三个座位、五个基准,二元那组共 4,500 次尝试;它承认一个重新校准过的基线在准确率上能打平甚至超过它;而且座位轮流换会让按座位识别失效,一个校准的时候很干净、之后才变坏的休眠者会一直继承信任。5
这四篇合起来,其实只回答了三件事:代价有多大、边界在哪里、补救从哪一步开始。它们都没回答的是:什么任务本来就不该交给一群人——是交给一个协调者,还是干脆只交给一个人。这一期里最好的那个数字,反而是那个「打平」:当一套传统求解器本来就握着完整状态时,多出来的 Agent 一个都没加分。
回到开头那个 64%。多智能体缺的不是智力,是一份大家都得看到、而且只有一个人有权改的状态。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content