调度器拿掉之后:一千零二十四个 Agent,同一个模型,分数涨了六成

调度器拿掉之后:一千零二十四个 Agent,同一个模型,分数涨了六成

同样一个模型,同一道题,一千零二十四个 Agent 一起干,通过率从三成四抬到五成五。

0:00 / 7:57
同样一个模型、同一道题,干活的 Agent 从一个加到一千零二十四个,通过率从三成四抬到五成五。这次改的不是模型,也不是提示词,而是把那个负责派活的中心调度器拿掉了。2026 年 9 月 22 日,微软研究院的七位作者挂出预印本《Agensh: Scaling Organizational Intelligence to 1,024 Agents》,第二天放出项目页:一层叠在单 Agent 外壳之上的组织外壳,让工人自己认领任务,靠共享工作区、消息接口和共享上下文把活儿接上。12
本期覆盖 9 月 22 日到 9 月 23 日的一手材料:预印本与项目页、它用的那套评测基准,以及它沿用的「共享上下文」这条思路更早的出处。34

本期听什么

  • 它不是一个新模型。 Agensh 是一层组织外壳,装在单个 Agent 的外壳上面:底下怎么推理、怎么调工具,仍然由原来那个外壳决定。1
  • 它把主管 Agent 取消了。 现在主流的做法是一个主管拆任务、派活、收结果,工人一多主管自己就成了瓶颈;这篇留下三件基础设施,让工人自己找活。1
  • 替代主管的是工作区、留言板和公共笔记本。 一套 git 当共享工作区,一个聊天服务器当消息接口,一块只追加、可全局搜索的板子放结论。14
  • 人数确实换来了分数,也换来了速度。 五个最难的任务上,工人从 1 加到 128,平均通过率从 19.31% 到 28.78%;pandoc 上从 1 加到 1024,从 33.89% 到 55.06%。1
  • 这篇没有给账单。 全部数字来自论文与项目页,没有独立复现;1024 个工人跑六个小时花掉多少 token 或多少钱,论文里没有。1

它不是新模型,是把派活的人取消掉

现在几乎所有主流的多 Agent 产品都是同一个结构:一个主管 Agent 理解目标、把任务拆开、分给并发工人,再把结果收回来拼好。Codex 的子 Agent、Claude Code 的子 Agent 与 agent teams、Copilot 的 fleet、Kimi 的 Agent Swarm,都是主管带工人。1
这个结构的问题是它的上限不在工人身上,而在主管身上:主管要理解每个人的进度,要判断谁在做重复的活,要把互相冲突的改动合并起来。工人加到几十个,主管就变成了那个排队的地方。这篇论文的做法是把这个位置空着,让工人自己认领自己的活。1

一千零二十四个工人,分数从三成四到五成五

考卷是 ProgramBench:给你一个编译好的程序加一份文档,没有网络,六个小时,你要从零写出一个行为一致的代码库,通过它自动生成的行为测试。作者挑了里面两百道题中最难的五个——FFmpeg、GROMACS、pandoc、PHP 解释器、ctags,参考仓库从两千七百多个文件到两万六千个文件、最多两百八十万行代码。3
五个最难的任务上,同时干活的工人从 1 涨到 8、32、128,平均最终通过率依次是 19.31%、20.68%、26.52%、28.78%。单独看 pandoc 这一条线:1 个工人是 33.89%,128 个是 50.94%,1024 个是 55.06%,相对单 Agent 提升约六成二。12
人数还换来了时间。pandoc 上,128 个工人在半小时就冲过三成通过率,32 个要一小时,8 个要一个半小时,单个工人两个小时都没过。六小时预算、同一个模型、同一个底层外壳,只改工人数量——这是这篇想说的事:人数本身成了一个扩展维度。1

拿什么替代了调度器:工作台、留言板、公共笔记本

共享工作区是一套 git(实现用 Gitea):工人各自在自己的检出和分支上改,往主分支合并,issue 和 PR 就是讨论区,合并冲突等于让人退回去重新对齐一遍。消息接口是一个聊天服务器(实现用 Mattermost):团队频道放公告,一对一私信用来在两个人抢同一块活的时候当场解决——私信会在对方当前这一轮工具调用返回时插进去,也就是能打断对方。1
共享上下文是一块只追加的板子,思路来自 6 月的一篇去中心化多 Agent 工作。工人往上写五类条目:观察到的行为、确认的事实、被证伪的尝试、正在认领的活、改完之后的摘要。其中被证伪的那条被作者标为最有价值——一条「这条路走不通」能让所有人不再花预算去试。条目有长度上限,最近的内容每轮都会渲染进工人的提示词,别人新写的条目会在下一次工具调用返回时插进去,想翻旧账就自己搜。14
这三件东西合起来,就是原来主管干的活:记进度、传消息、留结论。

每个工人跑的循环,和被人派的工人没什么不同

工人的循环是五步:读目标、别人的进度和新留言;认领一块活并在板子上公布;动手干;对照验收标准自己验一遍;验过了合进工作区,并公布改了什么、什么想法、证据在哪,然后回到第一步。工人之间完全异步,不用等谁。1
运行时是事件驱动的:每个工人配一个路由器盯着仓库活动和消息,事件有去重标识,投递失败按退避重试,进程重启后还能接着跑。两个兜底值得记住:工人闲了十分钟会被推一句「接着干」;一轮下来什么都没写进共享上下文,会被提醒去补写。上规模时也做了安排——开局每三十秒放一个工人,一小时之后每三秒放一个;1024 个工人跑在 16 个节点上,每节点 64 个;最后四十五分钟和五分钟各提醒一次,不要再开新功能,把 PR 合上,保证根目录的编译脚本能跑通。1

协作不是设计出来的,是长出来的

这篇最值得看的是工人轨迹:所有工人的提示词一模一样,只有编号不同,但合作形式随规模一层层冒出来。1
八个工人时,大家自己约一个接口、各写一块;有人发现撞车,主动换了一块互补的活。三十二个工人时,一块活会有几个人一起做:PHP 那条线上,几个人先批了一个改动,另一个人找到了反例,批准被撤回,作者改好,再重新审、再合并。一百二十八个工人时出现了专业化:挑评审人会看谁以前审过类似的,整合这件事也会整个交给一个能解冲突、能验证、能合并的同伴;pandoc 上两个人自己定了一个整合协议并被别人复用,失败几次后又改成「整轮更新、测试、检查、合并的权限都交给你」。一千零二十四个工人时,同一个角色会有好几个人:工人可以同时联系几个整合者,等第一个有效回复,取消其余,再交代码;有人失败了,同领域的人能接过来重做。1

这套东西的边界在哪

全部数字来自论文与项目页,目前没有独立复现。实验只用了一个模型(GPT-5.6 Sol,高推理档)、一个底层外壳(Copilot)、一个六小时预算,而且全程不许联网。1
边际收益在变小:pandoc 上从 128 个工人到 1024 个,人数多了八倍,通过率只再涨 4.12 个百分点。论文里也没有账单——没有 token 消耗,也没有金额。还有一条更根本的:它考的是「从零重建一个大程序」,这类活天生能拆、能并行、每一步都能被测试判对错;如果你的循环是一串必须按顺序过的判断,或者每一步都要等上一步的产出,那加人只会互相等。1

能搬回自己循环的四条

第一,先找瓶颈:如果主管 Agent 在拆任务、派活、合并结果上排队,先看这三件事能不能变成一块大家都能读写的地方,而不是换一个更聪明的主管。第二,工作台别自己造:git 的分支、PR 和冲突检测已经是最便宜的共享工作区与版本记录,沟通就用频道加私信。第三,让失败变成一等公民:把走不通的路写下来,并明确说清「被标成失败的东西不要重试」——你省的是别人的预算。第四,冲突要能当场打断:私信要做得进对方当前这一轮,否则两个人会同时改同一个文件,等到合并才发现;再给每个人一块自己认领的地,比事后重新划边界便宜得多。1
最后一句留给判断:人数不是免费的。先在小规模上验证它有用——从 1 到 8 往往只涨一点点,真正的跳跃在 32 之后——再决定要不要继续加。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content