先看结论
GUI Agent 在 Chrome、Office 里拿到的高成功率,不能直接外推到真正的专业工作。Workflow Gym 把考场换成 FreeCAD、QGIS、KiCad、Blender 等软件,覆盖 56 款专业软件、338 个真实工作流,平均操作链条超过 100 步。1
这场考试难在哪
任务来自领域专家的日常工作,经过环境统一、指令审核、专家复现和 Agent 预实验后才进入评测。难度被拆成 Easy、Medium、Hard 三档,最长任务达到 110 步;模型实际运行时,探索、犯错和重试还会把交互轮次推到 80–400 步。2
它的验收也更硬:有的任务比对导出文件,有的检查最终界面状态;论文报道的 60 道人评抽样中,自动评测与人评有 59 道一致,一致率为 98.3%。1
成绩单透露了什么
在文章转述的实验表里,Gemini 3.1 Pro 单次平均通过率为 30.67%,Kimi K2.6 为 29.68%;三次采样的 pass@3 则分别为 41.12% 和 41.42%。Gemini 3 Flash 在 Hard 题上的 pass@3 只有 2.67%。这些是该评测设置下的结果,不是对所有 GUI Agent 场景的独立总评。1
真正卡住 Agent 的四件事
- 长程一致性:做到后面忘了前面设过的参数。
- 错误恢复:点错后继续沿着错误状态推进,缺少可靠回退。
- 目标保持:流程完成了大半,却漏掉导出或最终验收。
- 专业软件理解:图层、网表、模式切换和精细拖拽,都不是通用常识能轻易覆盖的。
所以,Workflow Gym 的价值不在于再刷新一个漂亮榜单,而在于把「专业软件、长链路、硬验收」放到同一张成绩单上。对产品来说,当前更现实的形态仍是人盯住流程和验收,Agent 承担可检查的局部执行。




댓글
로그인하면 댓글을 작성할 수 있습니다.