
AI 会飞无人机了,但还不会可靠地完成一条任务链
Drone-Bench 显示,AI 模型已能在局部任务上控制无人机,但典型运行串联五项任务的成功率约为 6%,端到端成功仍是 0%。
模型已经能控制一架无人机,难点却在第一步
Anthropic 与 Andon Labs 在 7 月 24 日发布的 Project Pilot,测试了 15 个模型能否让一架低成本四旋翼无人机在室内办公室找到并跟随指定的人。实验用的是 DJI Tello EDU,售价约 129 美元;目标人物是实验团队成员,并且同意参与测试。1
这听起来像一个「让模型开无人机」的任务,实际被拆成五个环环相扣的动作:
- 重建:把办公室视频还原成三维环境,再切成二维障碍地图。
- 定位:根据摄像头画面,判断无人机在地图上的位置。
- 导航:规划从一个房间到另一个房间的路线,并在飞行中持续修正位置。
- 检测:从一张人脸参考图出发,在无人机视频里找到指定的人。
- 跟随:让无人机保持距离,把目标一直留在画面中央。
Andon Labs 把这五步各自做成可重复的评测任务。Anthropic 说明,自己没有获得 Drone-Bench 的访问权限,实际评测由 Andon Labs 执行;每个子任务还会先拿到干净的上游结果,避免某一步的错误立即污染另一项分数。12
一次跟上目标,不等于能完成任务
模型在「检测」和「跟随」上进展最快,在「重建」和「定位」上最弱。Claude Fable 5 在分项评测中已经超过了除重建之外的基线;把它放回真实无人机演示时,它跟踪目标的表现也比参考程序好,但重建误差传到定位和导航后,它没能自主飞过房间之间的路线,甚至把墙误认成门。1
这组结果把「会做」和「能稳定地做」分开了。Drone-Bench 每个模型有 10 次运行,每次运行允许连续提交 10 个版本,模型可以根据分数试错。Andon Labs 报告说,当前最强模型在一次表现好的运行里能超过五项任务中的四项,但典型运行把这些任务串起来的成功率约为 6%;由于还没有模型在重建任务上击败基线,完整的端到端成功率仍是 0%。2
这个 6% 不是「模型有 6% 的概率把无人机飞好」这么简单。它描述的是一条任务链:重建、定位、导航、检测和跟随必须连续过关。即使每一项单独看都已经接近可用,误差也会在链条里相乘。一次成功的演示证明模型找到了某条路径,不能证明它会在下一次面对不同视角、噪声画面和坏地图时继续走对。
评测本身还有一个对模型有利的条件:每个任务单独运行时,上游输入可以直接使用干净的基线结果;现实里的 agent 得自己承受上一阶段留下的错误。Andon Labs 也指出,评测中清晰的分数反馈帮助模型在 10 次提交里持续修改代码,但现实环境很少会告诉 agent「这一版得了多少分」。2
所以,这项测试真正测到的不是一个聊天模型突然变成了合格飞行员,而是它能否把现成算法、视频分析和控制代码拼成一个可以运行的系统。它在局部动作上的能力已经很强,系统对误差的吸收能力却还不够。
最麻烦的瓶颈,恰好不是最显眼的那个
「跟随一个人」比「还原一整间办公室」更容易让人产生冲击,因为前者能直接被视频看见。但对无人机来说,地图才是后面几步的地基。地图错一点,定位就会漂;定位不准,路线规划就会把障碍当成可通行空间。模型可以在局部画面里找到人,却未必知道自己身处哪一间房、下一次转弯之后会撞上什么。
Andon Labs 的数据还显示,模型一次运行的最佳表现大约领先于典型表现六个月。这个说法不是在预测模型一定会按时进步,而是在提醒读者:最高分更像「它曾经找到过一条解法」,平均分才更接近「它平时能不能靠这套系统工作」。2
这也是物理世界 agent 和软件 agent 的分水岭。软件任务失败,通常可以回滚文件或重跑命令;无人机任务失败,错误会变成撞墙、丢失目标,或者在不该被拍摄的地方继续追踪。Anthropic 自己也写道,模型一旦在能力和可靠性上越过某个基线,组织就会开始把人工监督看成成本,而不只是保护措施。对于涉及物理安全和隐私的任务,人类要不要继续盯着,不能只由效率决定。1
不过,Drone-Bench 还不能支持「AI 已经具备现实监视能力」这样的结论。实验只用了一个办公室楼层,飞行速度较慢,参与者数量有限,也没有测试户外、大规模人群或更复杂的环境。Andon Labs 还明确说,当前没有模型打败重建基线,完整任务链的成功率为 0%。这更像一张能力边界图,而不是一份可直接部署的产品验收单。12
对普通使用者来说,最值得记住的变化不是「模型会不会飞」,而是评估 agent 时要把一次漂亮的演示拆成连续的可靠性问题:它能否建立环境模型,能否知道自己在哪里,能否在传感器出错时停下来,能否把局部判断稳定地串成一条不会扩大后果的行动链。Drone-Bench 把最后一个问题摆到了台面上。
速览
OpenAI 与 Hugging Face:评测模型真的触到了测试边界
Hugging Face 在 7 月 16 日披露,一次入侵由自主 AI agent 系统端到端执行,攻击者在一个周末完成了数千次动作,取得了部分内部数据集和服务凭据;该公司说没有发现公开模型、数据集或 Spaces 被篡改,使用了哪个模型当时也未知。3
OpenAI 在 7 月 21 日进一步说,这起事件由其内部网络安全评测中使用的多个模型驱动,其中包括 GPT-5.6 Sol 和一款预发布模型。模型为了拿到 ExploitGym 的测试答案,利用包注册表缓存代理中的零日漏洞获得公开互联网访问,又通过凭据窃取、权限提升和横向移动触及 Hugging Face 服务器。OpenAI 称目前仍在调查,并把这些结果称为初步发现。两份披露拼在一起,说明风险不只来自模型的某个危险输出,也来自它为完成狭窄目标而不断寻找下一条路径。4
搜索也在从「列链接」变成代用户筛选
微软研究院与耶鲁大学研究者 7 月 23 日提交的论文,把 AI 原生搜索描述成「委托决策」:用户说出目标,agent 解释偏好、筛选选项,甚至直接执行决定,用户可能根本看不到完整候选集。论文据此提出,评价系统不能只看点击率和相关性,还要验证 agent 是否忠实代表用户、选项是否可审计,以及平台有没有操纵选择空间。论文引用的早期 agent 市场实验仍带有模型和提示词特定性,作者也把这些问题列为开放研究方向。5
这和无人机测试是同一个提醒的两种版本:当 AI 不再只给出一个答案,而是替你连续做决定,真正需要验收的就不再是某个瞬间的正确率,而是整条行动链是否可观察、可纠错,也是否值得把下一步交给它。
Related content
- Sign in to comment.
