
Drone-Bench:Fable 5 四项过线,AI 无人机仍卡在环境重建
Anthropic 与 Andon Labs 的 Drone-Bench 显示,Fable 5 在五项无人机定位跟随任务中四项超过 human-AI baseline,但环境重建误差和最佳与平均表现的差距仍让端到端自主监控停在零成功率。
Fable 5 在 Drone-Bench 的五个子任务里,有四项超过了 Anthropic 与 Andon Labs 设定的 human-AI baseline,但这还不等于无人机监控已经具备可部署的自主性。Andon Labs 的评测页给出了更硬的边界:当前没有模型通过 Reconstruct baseline,端到端成功率仍为 0%。真正暴露出来的不是「模型会不会让无人机动起来」,而是环境重建的误差会不会一路传到定位、导航和最终任务。1 2
五个子任务是一条有依赖关系的链
Anthropic 的原文把 Drone-Bench 设定为一个室内办公室任务:四旋翼无人机要找到指定的人,并在对方移动时持续跟随。Andon Labs 把这个目标拆成五项:
- Reconstruct:从办公室视频恢复 3D 模型、2D 障碍地图和帧的位置。
- Localize:把无人机当前画面匹配到地图,估计它在空间中的位置。
- Navigate:利用障碍地图规划跨房间路径,并在飞行中持续定位、修正控制噪声。
- Detect:根据目标人物的参考照片,在无人机视频中返回目标框。
- Follow:根据目标框控制无人机,让目标保持在画面中央并维持稳定距离。
这些任务不是五个互不相干的榜单项目。Reconstruct 产出的地图和位姿会被后续任务使用,错误会向下游传递;Detect 和 Follow 则更接近视觉识别与局部控制,因此更容易先取得进展。Andon Labs 的评测页明确说明,正式打分时会给下游任务干净的上游输入,隔离每一项能力;真正把模型自己的输出串起来时,误差才会完整复合。2

Fable 5 四项过线,真实演示仍会撞墙
Claude Fable 5 是这组模型里表现最好的一个。它在除 Reconstruct 外的四项任务上把 frontier 推过了 baseline,在真实无人机演示中,Detect 和 Follow 也明显好于参考算法。可一旦需要跨房间飞行,重建误差就开始放大:模型把墙判断成门洞,直接朝墙飞去。Anthropic 因此把 Reconstruct 称为当前唯一的瓶颈。1
这组结果里还有一个比「会跟随」更具体的信号。Fable 5 曾分析模拟视频中的地砖线条和消失点,估计机载相机的俯仰角,误差控制在 4 度以内;另一次运行里,它还为 Follow 环境构建了自己的 2D 俯视图,用来本地测试和迭代代码。这里能确认的是模型会调用视觉分析和局部建模来改进提交,不是它已经获得了通用的物理世界理解。1
这个 baseline 测的不是纯人类能力
Drone-Bench 的参考线由 AI 专家和 coding agents 一起写出,代表使用现代工具、但不是全职机器人专家的团队在当前条件下能做到的水平。它既不是未使用 AI 的人类下限,也不是集中投入的人机协作上限。模型超过它,说明模型在该子任务上达到了这支团队的参考表现,不能直接翻译成「超过人类」。1
评测还给了模型很强的试错条件。Andon Labs 对每个模型跑 10 次,每次运行允许提交 10 个版本,模型能看到分数后在同一上下文中修改实现。Fable 5 从首次提交到最佳提交的达标率从 2% 提升到 52%,说明分数反馈本身就贡献了大量进步。现实环境通常不会给出这样清楚的可验证反馈,因此 benchmark 里的迭代能力不能原样搬到部署现场。2
这也解释了为什么「最佳表现」和「稳定表现」必须分开看。Anthropic 统计 10 次模拟后发现,模型在五项任务中的四项至少有一次达到 baseline;但即使是 Fable 5,按平均表现计算也只达到其中三项。平均表现追上一次性最佳表现,大约晚了 6 个月。1

这两个统计口径并不矛盾。前者是在隔离任务里问模型「有没有做到过」,后者把问题推进到「通常能不能做到」。Andon Labs 进一步指出,五项任务按自身输出串联时,当前没有模型通过 Reconstruct baseline,所以端到端成功率仍为零。2
风险不在无人机本身,而在监督何时被撤掉
Anthropic 选择「定位并跟随一个人」,是因为它比机器狗取球更接近现实中的 aerial surveillance。搜救、灾害响应和合法公共安全属于正当用途;越权监控,以及不受约束的私人或组织使用,则是同一能力的另一面。实验使用的是商用 DJI Tello EDU,参与者是已同意被跟随的实验团队成员,环境也只是室内办公室。1
研究真正关心的治理节点,是模型从「需要人逐步批准」走向「人类监督被视为成本」的那一刻。对软件 Agent 来说,长程任务的自动执行已经在减少人工介入;硬件控制一旦也越过能力和可靠性阈值,物理安全与隐私就不能只按效率来决定是否保留人在回路中。1
读者应该怎样判断这项进展
已被这项研究支持的判断是:在一个受控办公室和模拟评测里,前沿模型已经能独立写出超过参考线的 Detect、Follow 等子任务实现,Fable 5 还展示了基于画面细节做局部分析的能力。尚未被支持的判断包括:模型能在真实复杂环境中稳定跨房间导航、端到端完成目标追踪,或已经适合户外人群场景。研究只测试了低速无人机、一个办公室平面和有限数量的人,也没有覆盖户外大人群等更现实的条件。1
后续版本最值得看三件事:取消每次提交后的明确分数反馈,让模型自己检查结果;让任务真正承接自己的上游输出;把单一办公室换成更复杂的环境,并用更接近专业操作的 baseline 衡量距离。只要 Reconstruct 仍未过线,「四项能力已过关」就仍然是能力前沿的描述,不是无人机自主监控已经完成验收的结论。
相似内容
- 登录后可发表评论。
