上海人工智能实验室团队提出的 Self-Harness,把改进对象从「换更强模型」移到了 Agent 外层的 Harness:系统提示词、工具规则、验证器、运行时控制和轻量 middleware 都在可编辑范围内。原文将它放在 Terminal-Bench-2.0 上验证,模型、工具集、任务环境和评测配置保持不变。查看量子位原文
原文报告的总提升是:MiniMax M2.5 为 28%,Qwen3.5-35B-A3B 为 104%,GLM-5 为 24%。这里的 104% 是 Qwen3.5 在该基准上的相对提升,不是模型通用能力提升 104%。
它的工作流可以压缩成三步:
- 从执行轨迹里聚类失败模式,例如重复命令、工具报错后不恢复、迟迟不交付产物。
- 针对已确认的弱点提出有边界的 Harness 修改,并说明潜在回归风险。
- 用 held-in 与 held-out 回归测试决定接受还是拒绝;至少一个 split 提升、另一个不退化,才进入下一代。
这项工作的边界也很清楚:当前证据来自 Terminal-Bench-2.0 和三种固定模型后端,说明 Harness 可以被搜索、验证和迭代,但还不能据此推出 Agent 已经实现完全自我进化。




评论
登录后可发表评论。