一个分数不够:HarnessEval-W 把世界模型评测做成了 Agent 循环

解读 8 月 17 日提交的 HarnessEval-W 论文,拆解它如何用案例级路由、专门子 Agent 和证据树,把世界模型评测从一次性打分改成可复核的工程循环。

一个分数不够:HarnessEval-W 把世界模型评测做成了 Agent 循环
0:005:56

节目导览

2026 年 8 月 17 日提交的论文 HarnessEval-W: Agentifying the Evaluation of Visual Worlds,把一个常见的评测难题摆到台面上:世界模型生成的不是一次性答案,而是一段包含观察、动作和状态变化的 rollout。只给一个总分,团队很难知道错在画面、动作、物理因果,还是长期一致性。1
本期围绕一个问题展开:如果被评测对象已经是一个复杂系统,评测本身是不是也应该变成一条可检查的 Agent 循环?

从分数到证据树

HarnessEval-W 按案例上下文选择适用技能,把评测问题拆成可测量的子问题,再让带有专门工具的子 Agent 分别取证,最后由父 Agent 验证并聚合。它保留技能路由、子问题、帧级证据、诊断、父 Agent 复核和分数聚合之间的关系,形成一棵可以回看的证据树。2
这个设计最重要的变化,不是把评测器换成更大的模型,而是把「为什么得到这个分数」变成评测结果的一部分。论文把观察质量、状态转移正确性和世界持久性拆成多组设置;项目页则把它描述成由专门技能组成、可持续扩展的评测系统。23

结果能说明什么,不能说明什么

论文报告了 330 个案例、18 个世界模型,以及与人类偏好和 WBench 协议的对比结果。在物理转移设置中,作者报告的成对准确率从 31.9% 提升到 71.7%;在意图转移设置中,准确率从 60.2% 提升到 77.8%。这些数字说明细粒度取证可能比一次性整体打分更接近人的判断,但它们仍然是作者实验中的结果,不等于跨模型、跨后端和跨场景都已稳定复现。2
项目公开了评测代码、案例和示例运行方式,并采用 Apache License 2.0。不过,仓库仍把托管式评测服务、完整案例数据和模型生成示例列为待完成事项;不同接口的世界模型也需要转换到各自的输入形式。4

给 Agent 团队的落地启示

如果你正在搭建自己的 Agent 评估循环,可以先从一个最容易出事故的能力开始,不要一上来追求万能评测器:
  • 把评测案例写成带初始状态、动作、预期变化和判定边界的对象,而不是一段不可追踪的提示词。
  • 让评测结果同时包含分数、证据位置、失败诊断和可复核的原始产物。
  • 记录评测器为什么启用或跳过某项检查,并把技能版本、案例版本和被测运行绑定起来。
  • 在自动据此改模型或改策略之前,先用一批人工偏好或人工复核样本校准评测器,并单独测它的重复性与成本。
真正值得带走的,不是「评测也用了 Agent」这句话,而是一个更硬的标准:下一次有人质疑分数时,你能不能沿着证据树回到案例、动作、观察和验证步骤?
AI Loop Engineering 每日深度播客

AI Loop Engineering 每日深度播客

聚焦 AI Loop Engineering 前沿,每日一期:事件播报 + 技术深度解读,帮你在通勤途中跟上 Agent 工程最新脉搏。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel