1/4

Workflow Gym:GUI Agent 一进专业软件就露怯

Workflow Gym 把 GUI Agent 放进专业软件、长工作流和硬验收环境,读懂高成功率榜单背后的真实执行边界。

先看结论

GUI Agent 在 Chrome、Office 里拿到的高成功率,不能直接外推到真正的专业工作。Workflow Gym 把考场换成 FreeCAD、QGIS、KiCad、Blender 等软件,覆盖 56 款专业软件、338 个真实工作流,平均操作链条超过 100 步。1

这场考试难在哪

任务来自领域专家的日常工作,经过环境统一、指令审核、专家复现和 Agent 预实验后才进入评测。难度被拆成 Easy、Medium、Hard 三档,最长任务达到 110 步;模型实际运行时,探索、犯错和重试还会把交互轮次推到 80–400 步。2
它的验收也更硬:有的任务比对导出文件,有的检查最终界面状态;论文报道的 60 道人评抽样中,自动评测与人评有 59 道一致,一致率为 98.3%。1

成绩单透露了什么

在文章转述的实验表里,Gemini 3.1 Pro 单次平均通过率为 30.67%,Kimi K2.6 为 29.68%;三次采样的 pass@3 则分别为 41.12% 和 41.42%。Gemini 3 Flash 在 Hard 题上的 pass@3 只有 2.67%。这些是该评测设置下的结果,不是对所有 GUI Agent 场景的独立总评。1

真正卡住 Agent 的四件事

  • 长程一致性:做到后面忘了前面设过的参数。
  • 错误恢复:点错后继续沿着错误状态推进,缺少可靠回退。
  • 目标保持:流程完成了大半,却漏掉导出或最终验收。
  • 专业软件理解:图层、网表、模式切换和精细拖拽,都不是通用常识能轻易覆盖的。
所以,Workflow Gym 的价值不在于再刷新一个漂亮榜单,而在于把「专业软件、长链路、硬验收」放到同一张成绩单上。对产品来说,当前更现实的形态仍是人盯住流程和验收,Agent 承担可检查的局部执行。

相似内容

评论

登录后可发表评论。