
四模块、两条Loop与一套资产:美团披露工业级 Agent 评测体系
美团技术团队发布《Agent 评测白皮书》系统阐述工业级评测框架,通过四个核心模块、双闭环演进机制与长程行为评测资产,解决复杂智能体从原型走向规模化落地的质量评估难题。
大模型底座能力的快速进化与智能体工程框架的成熟,显著降低了原型开发的技术门槛1。工程团队只需拼接提示词、注册若干工具接口,即可在数天内搭建出一个具备多步交互能力的 Agent 演示原型。
这种原型阶段的顺利往往掩盖了规模化落地的真实阻碍。美团技术团队在 2026 年 9 月 10 日发布的《Agent 评测白皮书》系列首篇《评测全览》中指出,过去三年行业内大量 Agent 项目在迈向生产环境时陷入停滞1。很多项目停留在演示状态,一旦接入真实用户流量就会暴露长尾场景覆盖不足与输入脏乱的问题;部分项目在灰度扩量阶段频繁出现未预期的链路故障,研发人员难以定位具体错误层级,改动 Prompt 又可能破坏已有能力;还有许多团队经历了多轮模型切换与提示词重构,却始终无法向业务方量化证明系统带来的增量收益。
造成这些困局的核心症结,在于团队缺乏一套可信的工程化度量机制。决策长期依赖个人直觉与个别正向个案,面对多步骤、长执行链的复杂系统时,这种评估方式极易失真。为此,美团图灵 Agent 评测团队提炼出了覆盖全生命周期的工业级评测框架。
完备评测体系的四层架构
美团将工业级评测体系划分为四个核心模块,分别承担不同的工程职能1。这四个模块相互支撑,共同构成了一套完整的质量控制底座。

第一项是离线评测,它扮演版本变更的发布门控角色。当基座模型升级、提示词微调、知识库刷新或业务技能上下线时,离线评测借助固定的测试用例集与高保真运行环境执行回测,确保版本迭代不引发已有能力的退化。
第二项是在线评测与在线监控,负责在生产环境捕捉未知的真实表现。在线监控偏向运维视角,追踪工具调用成功率、网络超时率、接口延迟与 Token 成本,确认系统是否保持运转;在线评测偏向业务质量视角,借助 AB 分流、影子流量回放和周期性巡检,检验 Agent 是否高质量地完成了用户委托的任务。
第三项是Case 挖掘与归因,构成整套体系的流转中枢。该模块汇集线上异常信号与真实采样样本,通过链路剖析定位问题究竟发生在意图理解、任务规划、工具调用还是环境交互环节,并将样本分流沉淀为测试资产。
第四项是Agent 观测基建,充当所有评测动作的基础支撑。通过在 Agent 框架中嵌入全链路 Trace 插件,系统得以白盒化记录模型的多步推理过程、参数输入输出与外部系统调用细节,为故障复现与归因提供必要的数据支撑。
双闭环演进机制:系统进化与量具校准
一套具备自适应能力的评测体系,本质上是由两条紧密咬合的闭环循环驱动运转的1。

第一条路径是 Agent 迭代 Loop(系统演进)。线上流量在运行过程中暴露出错误样本,归因环节确认具体根因位于 Prompt 表达歧义、技能描述重叠还是上下文信息丢失。工程团队据此提交代码与配置修复,随后将变更提交至离线评测集执行回归验证,确认安全后部署上线并通过 AB 测试观察真实业务转化。这一闭环确保 Agent 的能力持续提升,同时牢牢守住既有质量底线。
第二条路径是 评测体系迭代 Loop(评测演进)。很多团队容易陷入单向假设,默认评测集永远正确、只要得分下降就一定是 Agent 出现问题。实际上随着业务规模扩大与用户行为演化,初始评测集和评价细则(Rubric)会出现代表性缺失或判罚偏颇。线上监控捕获的新型坏例如果超出评测集范围,团队便将其扩充至评测资产库;如果归因表明评测标准本身存在误判,团队则针对性迭代二元化评分项。这一机制逐步消除了冷启动阶段由人工制定规则带来的“独裁者偏差”,实现了评测工具自身的动态校准。
两条循环在输入端通过“Case 挖掘与归因”共享线上真实数据,在输出端通过“评测资产(评测集)”共享门禁标准。评测集越完善,离线门禁拦截缺陷的效率就越高;线上暴露的潜在漏洞减少,团队便能将更多精力投入到高质量特性的迭代中。
行为评测的解法:任务三元组与分层评测集
短程对话助手与长程业务 Agent 在评测逻辑上存在根本差异1。传统的 ChatBot 评测通常依赖字符串级别的答案匹配,而长程 Agent 涉及多步环境交互与中间产物生成,往往缺乏单一的标准字符串答案。长程场景的评测重点因而转向对 Agent 动作路径与最终环境状态的行为评测。
美团借鉴 Anthropic 的 Task 规范,将评测集中的每一条样本定义为包含输入指令、预期行为和评价细则(Metrics & Rubric)的结构化单元1。针对长程任务主观性强、评分分歧大的难点,美团推行二元化(Binary)Rubric 实践:将“生成的报表是否优质”等抽象评语,彻底拆解为一组可明确回答“是/否”的硬性检查项,例如特定指标是否完成跨表校对、环比计算公式是否正确应用等。这种细化手段大幅提升了人工标注之间以及人机判断之间的一致率。
在评测集组织上,美团将用例库明确划分为端到端评测集与过程评测集两大类别1。

以白皮书贯穿全文的“商家经营分析 Agent”为例,该智能体需要协同调用外卖投放、门店流量、团购活动等多个技能,最终为商家输出诊断 PPT 报表1:
- 端到端评测集立足最终用户视角,检验业务交付结果。系统运行 100 次长程任务,统计最终交付合格报告的比率。该指标回答“事情有没有办成”,起到拉响系统风险警报的作用。
- 过程评测集深入执行链条内部,拆解各个子模块。当综合交付率由 68% 跌落至 55% 时,端到端指标无法指明原因;过程评测集则能直接标出是“投放数据 Skill 调用成功率”从 95% 跌到了 70%,还是“多表数据合并正确率”发生了异常。该指标回答“问题出在哪一步”,确保警报拉响后能够直接明确对应的模块负责人。
美团强调,评测集的分层拆解应当由真实业务问题逐步推演建立,过早追求详尽复杂的层级设计容易陷入过度设计的泥潭。
线上反馈体系:监控、评测与巡检协同
离线测试集即便设计得再全面,也无法完全穷尽真实线上的分布变化。完备的体系必须仰赖线上环境的持续反馈机制1。
在线监控与在线评测的分工界线十分明确:监控关注运维指标,评测关注质量表现。如果某个 API 接口每次调用都返回 HTTP 200 状态码,但响应报文中包含了错误的计算数值,监控看板会呈现全绿的健康态势,在线评测则会直接标红告警。
连接两者的关键抓手是周期性巡检。工程团队从离线评测集中抽取代表性任务,以定时调度的方式在线上生产环境中回放执行。巡检既能够持续监测关键业务链路的成功率变化,又能在指标异常时将失败样本实时输入给 Case 池,为后续的故障排查提供稳定的第一手线索。
针对线上流量的数据采集,美团组合运用了四类数据源1:
- 线上主动反馈:收集用户的点踩与投诉记录,捕获明确的体验痛点;
- 监控告警回捞:抓取接口超时、抛出异常与重试超限的执行样本;
- 业务规则过滤:通过对话轮次超标、Token 骤增或敏感关键词匹配异常链路;
- 全量随机采样:定期抽取固定比例的正常交互日志,人工或机评介入审查。
四类渠道相互覆盖盲区。随机采样虽然处理成本偏高,却是捕获未知异常模式的必要手段。
归因分析与观测基建建设原则
从线上捕获到的异常用例只能证明“系统在此处失败”,团队还需要追溯“系统为何失败”1。归因分析依赖全链路白盒化的观测基建,将执行过程层层展开,逐级排查意图抽取、规划逻辑、环境输入、工具返回值以及最终汇总。
定位清楚根因之后,良性样本会被吸纳进黄金集以树立行为标杆,劣性样本则被归入错题集以建立回归门禁。团队必须坚守一条底线:任何已知出现过的错误案例,都不允许在后续版本中重复出现。
在落地路径上,美团建议工程团队遵循“按阶段适配”原则,避免脱离实际盲目攀比成熟度1:
| 发展阶段 | 观测基建水位 | 评测集构建 | 回测与门控机制 | 核心建设重心 |
|---|---|---|---|---|
| 冷启动阶段 | L1:具备单次调用的完整输入输出与工具日志 | L1:人工整理数十条核心场景端到端任务 | L1:代码提交流程嵌入基础自动化回测 | 优先跑通“最小可归因”闭环,验证核心业务可行性 |
| 扩量阶段 | L2:覆盖链路耗时、Token 统计与子步骤状态 | L2:沉淀必过集与细分模块过程评测集 | L2:分层门禁,安全性一票否决,体验项设阈值 | 搭建线上巡检与监控联动,打通坏例流转枢纽 |
| 成熟运营阶段 | L3:全链路白盒化 Trace 与自动化异常打标 | L3:引入自动化扩展的挑战集与规模化机评 | L3:灰度影子流量回放与持续在线 AB 评估 | 推动评测标准与 Agent 系统的全自动持续演化 |
美团特别提醒,实践中最易失效的形态是“离线评测与在线监控割裂”。团队同时维护着离线测试集与运维监控大盘,中间却缺少 Case 挖掘与归因的流转通道。线上暴露的新型问题无法及时注入离线门禁,离线测试所得的高分也无法映射到真实的业务指标增长。
对于垂直业务领域的 Agent 而言,系统能力评估无法套用基座大模型的离线打榜模式。离线评测集的主要价值在于承担回归防护,防范功能退化;真实的综合业务收益,最终仍需依托线上 AB 测试在实际商业指标中给出检验1。
References
- 1《Agent 评测白皮书》系列01:Agent 评测全览
tech.meituan.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- 支撑 10 亿用户与 7000 万 QPS:OpenAI 拆解在线存储平台 Habitat 的架构演进与 Python 尾延迟治理
- ToolGrad:倒置搜索顺序,Google 用 500 条逆向合成数据让 12B 模型反超教师
- Anthropic 前沿红队实测:大模型在战术目标定位与无人机飞控上的能力边界
- 0.81% 假阳性率背后的五段闭环:OpenAI Defense Factory 架构拆解
- 从静止到奇点:OpenAI 声称的 Navier–Stokes C/D 证明到底证明了什么
- 13 百万行 Lean、29,511 个定理:Claude 如何把费马大定理形式化
- E-Commerce Bench:365 天电商经营如何测出 Agent 的谈判、反欺诈与长期学习
