Coding Agent Harness Engineering 解决的核心问题,是让 Agent 能在长任务里持续推进。OpenAI 的工程实践把规划、执行、代码审查、测试、日志和指标接成反馈回路;Anthropic 的长任务实验也把任务拆分、结构化交接和评估器作为关键组成。12
长任务变难,常见原因包括上下文持续变长、目标逐渐失焦,以及 Agent 对自己产出的检查过于宽松。Anthropic 观察到,上下文重置配合结构化交接能缓解长任务中的连贯性问题;独立评估器也比让执行 Agent 自夸式自评更容易调校。2
一个实用的 Harness 通常包含「任务 → 规划 → 执行 → 独立评估 → 反馈回写」这条链。规划器把短需求展开成可交付目标,执行器一次完成一个小块,评估器按测试标准检查结果,计划、进度和测试结果则通过文件在不同会话之间交接。12
Harness 的基础设施可以先从三类能力开始:仓库地图让 Agent 知道去哪里找信息;工具、隔离环境和日志让 Agent 能行动并观察结果;测试、不变量和独立评估让结果拥有可检查的标准。OpenAI 的做法是用短小的
AGENTS.md 作为目录,把详细知识放进可维护的 docs/,再用检查器持续发现文档和架构漂移。1Prompt 负责一次任务里的指令,Skill 负责可复用的工作方法,Harness 负责长任务的运行、交接和验证。三者可以一起使用:Skill 能教 Agent 如何完成一类流程,Harness 再负责让流程分阶段执行,并把失败反馈带回下一轮。1
最小实践可以从一个小任务开始:先写清完成标准,再创建一份仓库地图;随后补上测试、日志和隔离环境,最后让执行 Agent 工作、让评估 Agent 复核,并把失败轨迹写回文档或工具。可直接阅读 OpenAI Harness Engineering 原文 和 Anthropic Harness Design 原文。
参考来源
- 1
- 2


评论
登录后可发表评论。