Google 把 Agent 评估接上生产:同一套分数,能不能让质量循环成立?

Google 将 Agent 与模型评估在 Gemini Enterprise Agent Platform 中推向 GA,本期拆解它如何把离线实验、生产 trace 和漂移告警接成一条质量循环。

Google 把 Agent 评估接上生产:同一套分数,能不能让质量循环成立?
0:005:56

节目导览

7 月 31 日,Google 宣布 Gemini Enterprise Agent Platform 的 Agent 与模型评估服务进入 GA。它把开发阶段的测试用例、Agent 执行 trace、统一指标和上线后的质量漂移告警接进同一条链路。1

你会听到什么

本期先还原一条完整评估循环:定义 eval case,执行 Agent,记录输入、输出和工具调用的 trace,再计算指标、分析失败、验证优化。Google 文档把 trace 定义为一次 Agent 行为的事实记录;评估既可以跑本地开发用例,也可以评估生产流量或外部日志。2
随后把重点放到线上:Online Monitor 会从 Cloud Trace 和 Cloud Logging 中按过滤条件取样,调用评估服务,再把结果写入 Cloud Monitoring;文档描述的常见调度间隔约为 10 分钟。它需要 Agent 导出包含会话、输入输出、系统指令和工具定义的 OpenTelemetry 信号,也需要用采样控制成本。3
最后讨论落地边界:20 多种预置指标、自定义代码指标和模型评审指标,解决的是测量与反馈基础设施,不会自动替团队决定回滚、收紧权限或接受一次错误的自动修复。质量告警可以按整体分或单项指标配置,示例包括任务成功率在 30 分钟窗口内低于 80%。4
听完可以带走一个判断:没有可复现的 trace,线上分数只是报表;没有受控的人工复核与回滚,红色告警也不是安全边界。

Related content

  • Sign in to comment.
More from this channel