AI Agent 的可靠性,靠一套能反复运行的评测回路建立:给任务和成功标准,让 Agent 在隔离环境中多次执行,保存轨迹与最终状态,再用合适的评分器判断。Anthropic 把评测拆成 task、trial、grader、transcript、outcome 和 evaluation harness。1
一次任务跑通,只说明某次试验成功。多轮 Agent 会调用工具、改写环境状态,错误也可能沿链路累积。评测因此要同时看最终结果和完成过程,不能只盯着最后一句回答。1
能力评测回答「现在能做什么」,可以专挑难题,允许较低通过率;回归评测回答「改完还稳吗」,要守住已有任务的通过率。两套评测一起跑,才有上坡的空间,也有防倒退的门槛。1
上手可以从 20–50 个真实任务开始:把手工检查和真实失败写成测试,明确输入、成功标准与边界;在干净环境中多次运行,读轨迹,检查评分器是否公平,再把成熟的能力任务沉淀为回归任务。1
References
- 1Demystifying evals for AI agents
anthropic.com
- 2Define success criteria and build evaluations
platform.claude.com


Comments
Sign in to comment.