Google 把 Agent 评估接上生产:同一套分数,能不能让质量循环成立?
早上好,这里是 AI Loop Engineering。今天只讲一条发生在七月三十一日的更新:Google 宣布,Gemini Enterprise Agent Platform 里的 Agent 与模型评估服务正式进入一般可用阶段。我的判断先放在前面:重点不是多了几种评分,而是开发测试、生产 trace 和质量漂移告警,开始使用同一条评估链路。工程团队要回答的,也从「怎么给 Agent 打分」变成了「同一个分数,能不能跟到生产」。
0:00 / 5:56

