
Google DeepMind 与 EVE Online 合作:把长期记忆与多智能体互动放进持续游戏世界
Google DeepMind 与 Fenris Creations 将 EVE 的持续世界、长期规划和多智能体互动作为新的游戏 AI 研究环境,但当前发布仍是研究议程与合作计划,而非能力评测结果。
Google DeepMind 在 2026 年 8 月 21 日发布的官方博客,宣布与 Fenris Creations 开展新的游戏 AI 研究合作。合作对象是 EVE Universe 背后的开发团队,研究环境包括 EVE Online、EVE Vanguard 和 EVE Frontier。这次发布最值得关注的地方,是研究问题从「怎样在一局游戏里赢」延伸到了「怎样在一个持续变化的世界里学习、记忆、规划,并与其他智能体相处」。1
原文定位
博客由 Alexandre Moufarek 和 Adrian Bolton 撰写,页面标注为 Research,发布时间为 2026 年 8 月 21 日。原文回顾了 Google DeepMind 从 Atari、围棋和即时战略游戏一路走到 SIMA 2 的研究线索,然后把 Fenris Creations 合作定义为游戏 AI 研究的下一章。1
这是一份研究合作公告和环境设计说明。原文没有公开新的模型名称、实验表格、benchmark 分数、训练代码或线上部署结果。读者现在能判断的是 Google DeepMind 选择了什么问题、为什么选择 EVE 作为环境,以及后续研究应当接受什么样的检验;读者还不能据此判断某个 Agent 已经在 EVE 中具备长期行动能力。
游戏 AI 的考题从固定目标变成持续世界
早期游戏研究把环境的优势用在了「目标清楚、反馈明确」这件事上。Deep Q-Network(DQN)从 Atari 2600 的原始像素学习,在 49 款游戏中直接通过得分获得反馈;AlphaGo、AlphaGo Zero 和 AlphaZero 把自我对弈扩展到围棋、国际象棋和将棋;MuZero 进一步在不知道游戏规则的情况下学习行动;AlphaStar 则把研究推进到《星际争霸 II》的实时决策和不完全信息。对这些系统来说,胜负、得分或任务目标提供了相对清楚的训练方向。1
SIMA 改变了问题的接口。这个 Scalable Instructable Multiworld Agent 通过屏幕看到游戏世界,理解自然语言指令,再用普通键盘和鼠标操作,不依赖游戏 API 或源代码。SIMA 2 在此基础上加入实时推理和对话,把研究重点从单个游戏的最优策略推进到跨多个 3D 环境的理解与行动。1

这两条路线的差别,在于系统面对的「变化」不同。固定规则游戏主要要求系统在给定目标下提升决策;持续世界要求系统在任务、知识、关系和规则都可能变化时继续行动。后一种条件会同时暴露遗忘、记忆检索、长期信用分配和社会互动中的失败,而一次胜负结果无法覆盖这些问题。
EVE 把四类长期能力放进同一个环境
Google DeepMind 选择 EVE,依赖的不是它拥有某个单独的游戏机制,而是它把多个长期条件叠在了一起。官方博客称,EVE Online 于 2003 年上线,是一个由数千名玩家共享、持续演化超过 20 年的单一宇宙;游戏中的经济由玩家推动,供需关系和贸易网络跨越数千个星系,联盟、冲突和外交则由人类互动塑造。1
这些环境特征对应四个不同的研究问题:
- 持续学习。 Agent 获得新技能后,需要保留已经学会的能力。EVE 的世界会持续增加新情况,因此测试重点会从一次训练后的成绩,转向技能变化后能否继续工作、旧技能是否被新知识覆盖。
- 长期记忆。 Agent 需要在更长的时间尺度上积累和取回知识。玩家关系、经济信息和历史行动的价值,可能跨越当前对话或当前任务;这会迫使研究者区分「模型能在上下文里看到什么」和「系统是否能在之后主动找回有用信息」。
- 长程规划。 EVE 中的目标可以涉及数周、数月甚至更长时间。Agent 需要把当前行动和遥远的结果联系起来,评估资源、承诺和风险,而不是只优化下一步动作。
- 复杂多智能体动力学。 合作、竞争、谈判、经济行为和涌现的社会行为会同时发生。Agent 面对的对象也不再只是一个给出分数的环境,而是会改变策略、形成联盟和响应行动的其他参与者。
这四项能力是官方博客提出的研究方向,不是这次合作已经完成的实验结果。博客没有报告 EVE 环境中的遗忘率、记忆检索成功率、长期任务完成率或多智能体对局结果。1
三种环境对应三个抽象层级
合作并没有把所有问题都压到 EVE Online 的实时线上世界里。三种环境承担的研究条件不同:
- EVE Online 提供大规模、单一分片的持续宇宙,适合研究长期经济、社会关系和跨时间行动。
- EVE Vanguard 以第一人称视角提供快速的地面战术决策,让研究者可以观察从即时动作到更大范围策略之间的联系。
- EVE Frontier 具有可编程的 Smart Assemblies 和开放、可扩展的架构,甚至允许世界规则本身发生变化,适合研究 Agent 面对新机制时如何适应。
这个分层设计有一个实际价值:研究者可以把「动作速度」「规划跨度」「世界规则是否稳定」拆开控制,而不必一开始就在所有维度上同时增加难度。Agent 能在第一人称场景里快速操作,并不代表它能管理长期资源;Agent 能记住一段历史,也不代表它能在规则改变后重新学习。1
先在隔离环境里学,再考虑接触真实玩家
官方博客给出的推进顺序也比「直接把 Agent 放进线上游戏」更谨慎。研究计划先从与真实玩家隔离的 EVE Online 离线实例开始;之后进入 EVE Frontier,把它作为研究人类与 Agent 如何共存的开放环境;只有在能力成熟后,团队才会考虑让系统进入 EVE Online 和 EVE Vanguard,目标是丰富人类玩家的体验。1
这个顺序把两个问题分开了。第一个问题是 Agent 能否在复杂世界中学习和行动;第二个问题是它进入有真实玩家、真实经济和长期后果的环境后,会不会破坏玩家体验。前一个问题没有结果,后一个问题就没有上线依据;即使前一个问题取得进展,后一个问题仍然需要单独的权限控制、行为审计和退出机制。原文目前只给出了环境和阶段安排,没有给出进入下一阶段的量化门槛。
这次发布的价值在研究议程,不在能力分数
把这篇博客当作新模型发布,会高估它的证据。文章真正提供的是一套更难的验收对象:Agent 要在持续变化的世界里保留旧技能、建立跨时间记忆、完成长期目标,并在其他 Agent 或人类改变环境时调整策略。
这也改变了后续实验应该怎样写。一个游戏演示可以展示 Agent 看懂了画面、完成了一段动作,甚至展示它和人对话;这些现象仍然无法回答它是否能在数天后找回关键记忆,是否会在学会新技能后忘记旧技能,是否能把多步行动的结果归因到早期决策,也无法回答它在合作和竞争之间如何选择。
所以,Google DeepMind 与 Fenris Creations 的合作当前更像是把研究问题放进一个合适的压力测试场,而不是宣布压力测试已经通过。EVE 的价值在于,它让短时演示之外的能力必须接受持续时间、世界变化和其他参与者的共同检验。
后续研究需要回答的五个问题
- 新技能会不会覆盖旧技能? 后续实验需要同时报告新任务适应速度、旧任务保持率和不同任务顺序下的遗忘情况。只报告最终分数,无法区分 Agent 是学会了新能力,还是牺牲旧能力换来的。
- 记忆是否真的跨越了当前上下文? 研究者需要说明信息保存、检索和更新发生在什么时间尺度,并用延迟任务检验 Agent 能否找回与当前目标有关的历史事实。一次长上下文里的正确回答,不能替代长期记忆评测。
- 长期规划怎样计算成功? 数周或数月的任务需要公开阶段目标、失败归因和资源消耗,否则读者无法判断结果来自规划、运气,还是中途的人为干预。
- 多智能体互动带来了什么代价? 后续材料需要区分合作、竞争、谈判、欺骗和共同错误,并说明 Agent 与人类玩家互动时怎样控制伤害、操纵和破坏行为。
- 离线能力能否安全迁移到线上? 从离线实例到 EVE Frontier,再到 EVE Online 和 EVE Vanguard 的每一步,都需要对应的准入指标、审计记录和可复现实验设置。1
这篇博客把游戏 AI 的研究边界往持续世界方向推了一步,但它交付的是问题定义和合作环境。真正的技术进展,要等后续材料把长期学习、记忆、规划和人机共存分别变成可测量、可复现、可审计的结果。
References
- 1
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
