MineExplorer:Claude-Opus-4.6 成功率约 41%,多模态模型卡在动态世界

MineExplorer:Claude-Opus-4.6 成功率约 41%,多模态模型卡在动态世界

美团 LongCat 把多模态模型放进 3 分钟动态 Minecraft 轨迹,18 款模型在隐藏前置和多跳任务上明显退化,感知与长程探索之间仍有距离。

3 分钟动态轨迹,最强模型整体成功率约 41%

把多模态模型放在一张截图前,它通常能说出画面里有什么。把它放进一个持续变化的 Minecraft 世界,给它一条没有写全前置条件的任务,结果就不一样了。美团 LongCat 团队的 MineExplorer 让每个实例运行最多 1800 个环境步,每步约 0.1 秒,相当于一段约 3 分钟的连续交互;官方文章称,18 款被测模型中,Claude-Opus-4.6 的整体任务成功率约为 41%。1
MineExplorer 不是把 Minecraft 当作知识问答题库。它要测的是模型能否在动态场景里持续观察、推断隐藏前置、导航、收集资源、执行动作,再根据新状态修正路线。论文把它定义为开放世界探索评测,并明确指出:强模型可以处理不少单跳任务,但当隐藏前置需要在更长轨迹中协调时,表现会快速下降。2

任务难在指令没有写完

一个 MineExplorer 复合任务由自然语言指令、初始状态、任务依赖图和里程碑检查器组成。依赖图里的所有节点不会直接写进指令,Agent 得从环境状态中推断要先完成什么。1-hop 到 4-hop 表示隐藏前置的依赖深度,hop 越多,任务链越长,模型要维护的状态也越多。3
构造流程先从 3382 个 Minecraft 原子任务中筛掉强依赖游戏专有知识的部分,保留 1497 个知识受控任务,再组合出 813 个经人工验证的复合实例。任务按 ReAct 风格拆为三类能力:
能力维度细分能力对应的失败风险
感知空间、时序、实体、状态、物品栏没看清目标位置或当前状态。
推理常识、因果、关系没推断出隐藏前置,或把依赖顺序排错。
行动移动、跳跃、采集、放置、合成、攻击已经知道要做什么,却没有走到或完成动作。
这种设计有一个实际好处:它把「会不会玩 Minecraft」与「能不能在开放世界里探索」尽量拆开。GitHub 仓库同时公开了 benchmark、任务生成器、评测脚本和 Minecraft 沙盒环境,开发者可以生成新任务或复跑已有评测。34

从 1-hop 的 77 到 4-hop 的 12

Claude-Opus-4.6 的整体成功率约为 41%,但这个平均数掩盖了任务深度带来的陡降:官方文章给出的结果是,1-hop 任务得分约 77,4-hop 任务降到 12。模型不是在所有任务上都稳定地差,而是在依赖链加深后无法持续维护状态和行动顺序。1
论文的主实验还报告了 18 款多模态模型,覆盖 Claude、GPT、Gemini、Qwen、Kimi、GLM、Seed 等模型家族。论文摘要对结果的概括比较克制:强模型能完成许多单跳任务,但协调隐藏前置的长轨迹仍然困难;模型更大或开启 thinking mode,也不稳定地带来更高表现。23
这里的「41%」还要和论文的消融口径分开看。对 Claude-Opus-4.6 的历史视觉帧缓冲实验中,1 帧、10 帧、20 帧、50 帧对应的 TSR 分别是 23.00、40.84、41.08 和 37.64。20 帧是主设置,因此论文表里的 41.08 与官方文章对整体成功率的四舍五入表达约 41% 可以对应,但不应把两者当成不同评测结论。3

看得见,不等于能把状态串起来

MineExplorer 的维度分析给出了一个比总分更有解释力的差距。以 Claude-Opus-4.6 为例,整体感知分为 61.91,推理分为 54.71。官方文章还称,在几乎所有被测模型上都能看到感知分高于行动分、行动分高于推理分的排序。这个结果支持一个较窄的判断:模型通常能从画面里提取信息,却更难把信息组织成一条可以持续执行的依赖链。1
失败归因进一步把问题落到了导航上。官方文章称,Claude-Opus-4.6 的失败案例中,导航失败接近 60%,其次才是资源收集、动作执行和目标识别。导航不是一个单独的视觉问题:它要求模型把目标、当前位置、地形变化和下一步动作放在同一个当前状态里处理。1
增加资源也没有直接修好这个缺口。多数能完成的任务在较早阶段已经完成,无法完成的任务即使跑到 1800 步也常常仍会失败;历史帧从 20 增到 50 后,TSR 反而从 41.08 降到 37.64。论文将其解释为旧观察可能干扰当前局面判断,但这仍是该实验设置下的解释,不是对所有视觉记忆系统的普遍定律。3

它能证明什么,不能证明什么

MineExplorer 适合检验三件事:模型能否从当前状态推断未明说的前置,能否在动态场景中保持依赖关系,能否把感知结果转成连续行动。它也适合作为任务生成和 Agent 训练的公开起点,GitHub 仓库提供了 Docker 沙盒、生成和评测脚本。4
但 Minecraft 仍然是一个特定沙盒。过滤游戏知识可以减少记忆 Wiki 的影响,却不能把 Minecraft 里的导航、资源和动作完全等同于现实物理世界。MineExplorer 的 41% 更准确的含义是:在这套动态环境、任务依赖和里程碑规则下,长程开放世界探索仍然是多模态 Agent 的薄弱环节;它不是现实机器人已经准备好的证明。23

Related content

  • Sign in to comment.
More from this channel