AI 编程与应用情报:代理开始进入计量、编排与投入账本

AI 编程与应用情报:代理开始进入计量、编排与投入账本

GitHub、Google 和 OpenAI 的近期更新显示,AI 代理正从单次调用走向仓库级计量、全链路编排、跨应用执行和按有效结果核算投入。

先看结论

北京时间 7 月 14 日至 18 日,几条更新把 AI 代理的落地问题往前推了一步:代码代理开始按仓库统计产出,云平台把构建、评测、部署和治理串进 coding agent,搜索产品开始直接调用第三方应用,企业采购则被要求从「用了多少 token」转向「交付了多少可接受结果」。这些材料来自厂商官方发布,能说明产品方向和可用路径,但不能单独证明普遍的生产收益。
条目发生了什么影响谁下一步看什么
GitHub Copilot 仓库级指标GitHub 将 Copilot coding agent 和 code review 的每日 Pull Request 活动下沉到仓库维度,包括代理创建、合并的 PR,以及代码评审建议按评论类型的数量。1需要衡量 AI 编程投入的工程组织把仓库级活动与通过率、返工率、审查耗时和线上缺陷关联起来,不要把 PR 数量直接当生产力
Gemini Enterprise Agent Platform 13 个演示Google Cloud 发布 13 个 hands-on demos,覆盖 ADK 构建、人工审批、MCP、A2UI、长任务、部署、Agent Gateway、评测和跨框架编排;Agents CLI 可以给 coding agent 加入 ADK 与 Agent Platform 技能。2要从原型走向可评测、可治理代理的开发团队先按示例搭一条可回放的任务链,确认哪些组件已对自己的区域、账号和数据开放
Google AI Mode 连接应用AI Mode 开始支持连接 Instacart、Canva、YouTube Music 等服务,用户可以从搜索结果中加购物车、找模板或保存播放列表;首轮从美国开始逐步推出。3做消费级 AI 助手、工作流集成和增长产品的团队看授权、确认、撤销和跨应用失败后的状态反馈,不能只看能否调用 API
Google Images 的生成式入口Google Images 新增可浏览的动态首页和 Collections;Google 还计划把图像生成放入 Search 的 AI Overviews,使用 Nano Banana 模型,英文版将分批开放。4图像搜索、内容创作和视觉营销产品区分搜索已有素材与生成新图的版权、来源标记和用户预期
OpenAI 的企业投入方法OpenAI 建议企业用「每美元完成的有效工作」衡量 AI,进一步拆到每个可接受结果的模型、工具、重试、延迟和人工复核成本。这是 OpenAI 的管理建议,不是独立行业基准。5负责 AI 预算、平台治理和业务流程改造的负责人先选一个有明确验收标准的流程,记录单位结果成本,再决定是否扩大额度

GitHub 先把「用了多少」拆到仓库

GitHub 的新接口将 Copilot usage metrics 从组织和用户层面扩展到仓库层面。企业和组织报告现在可以按天查询单个仓库的活动:Copilot coding agent 创建或合并了多少 Pull Request,Copilot code review 审查了多少 PR,以及建议按评论类型的拆分。该功能面向企业所有者、计费管理员、组织所有者和拥有 View Copilot Metrics 权限的自定义角色,且组织必须启用 Copilot usage metrics policy。1
这对工程管理的价值很直接:团队终于可以把 AI 活动和代码库、服务边界联系起来,而不是只看一个组织总数。GitHub 将其描述为 repository insights 和 AI-readiness reporting 的基础,但接口本身只记录活动,不会自动回答这些 PR 是否带来更好的交付结果。
实际采用时,至少要把四类数据放在一起看:代理创建的 PR 是否通过审查,人工修改了多少,完成一个变更用了多长时间,之后是否产生回滚或缺陷。单看「代理合并了多少个 PR」很容易把低价值的小改动和真正完成的业务工作混在一起。

Google 把代理开发链做成一组可运行样例

Google Cloud 发布的 13 个演示覆盖了从构建到优化的完整路径。内容包括用 ADK 创建基础代理,用 MCP 连接 BigQuery、文件和 API,用 A2UI 动态生成界面,部署有记忆能力的代理,处理可以暂停和恢复的长任务,以及通过 Agent Gateway、mTLS、IAP、IAM 和 Model Armor 约束工具调用。2
其中一个费用审批示例保留了比较完整的工程边界:低于阈值的费用自动处理,高于阈值的请求先做 PII 脱敏和提示注入防护,再经过合规分析,最后停下来等待人工审核。另一个示例用 Agents CLI 生成部署配置,接入 Cloud Trace、Cloud Logging 和 BigQuery Agent Analytics。这里的重点不是演示数量,而是把「能回答」拆成了「能部署、能暂停、能追踪、能复盘」。
不过,这些页面仍然是 Google Cloud 提供的参考实现。演示中能跑通,不等于所有账户、区域和企业数据条件都已满足。开发团队可以先挑一个带人工审批的例子,替换成自己的任务和验收数据,再检查权限、日志和失败恢复是否真实可用。

AI Mode 开始替用户跨应用做事

Google 7 月 16 日公布的 Connected Apps 把 AI Mode 从搜索与回答进一步推向执行:连接 Instacart 后,用户可以把购物清单加入购物车;连接 Canva 后,可以查找设计模板;连接 YouTube Music 后,可以生成并保存播放列表。首轮从美国逐步推出,Google 还表示会继续接入更多合作应用。3
这类产品的验收标准不能只写成「调用成功」。应用连接意味着授权范围、用户确认、第三方页面跳转、重复执行和部分失败都要有明确状态。例如商品已加入购物车但结算没有完成,助手要告诉用户停在哪一步;用户撤销连接后,历史授权和已保存内容如何处理,也需要能被查到。
对做 AI 应用的团队来说,连接应用的价值在于缩短从意图到动作的路径,风险也在同一个地方。动作越靠近真实账户,确认和撤销就越应该成为产品主流程,而不是设置页里的补丁。

搜索产品同时开始生成图像

Google Images 25 周年更新包括两个方向:一个是新的动态浏览首页,用户可以按兴趣浏览来自全网的图像,并把想法保存到 Collections;另一个是把图像生成放进 Search 的 AI Overviews,用户可以用文字提示直接创建图像。Google 说明后者将使用 Nano Banana 模型,英文版会在未来几周向目前支持 AI Mode 图像创建的地区逐步开放。4
这让「搜索素材」和「生成素材」出现在同一个入口里,但两者的责任不同。搜索结果需要让用户知道素材来自哪里,生成结果则需要处理合成标识、来源解释和商业使用预期。对内容团队来说,后续要观察的不是生成按钮有没有增加,而是 Google 如何把两类结果放在同一页里,用户能否清楚分辨它们。

企业预算要按可接受结果结算

OpenAI 7 月 14 日发布的企业管理文章建议,企业不要只拿 token 价格或信用额度判断 AI 投资回报,而应计算「每美元完成的有效工作」。文章给出的拆解包括任务完成数、节省时间、决策质量和可扩展的工作流,并建议把模型与工具使用、重试次数、完成率、延迟和人工复核都计入「每个可接受结果的成本」。5
这套方法与 GitHub 的仓库级指标可以接上:仓库活动告诉团队 AI 在哪里被使用,代码审查通过率、返工和缺陷才告诉团队这些使用是否产生了可接受结果。客服、财务或运营流程也一样,先把「完成」定义清楚,再比较不同模型和代理配置的总成本。
需要保留的是,这篇文章属于 OpenAI 的产品与管理建议,文中关于价格下降、模型效率和企业部署的内容不能当成独立测量。它适合作为预算表的字段起点,不能替代团队自己的评测。

给团队的判断

  1. 先建立结果口径,再看代理活跃度。 PR 数、调用次数和 token 消耗适合回答「用了多少」,不能单独回答「交付得怎么样」。
  2. 把可暂停、可回放和人工接管放进第一版。 Google 的演示把审批、长任务和日志放在开发链里,这比上线后再补治理更容易验证。
  3. 凡是连接真实账户,都要测试失败状态。 购物车、设计文件和播放列表只是低风险例子,企业内部系统一旦加入,授权撤销和异常恢复会变成硬要求。
  4. 用一个流程算单位结果成本。 先选择有清晰验收标准的代码变更、客服工单或审批任务,把模型、工具、重试和人工时间都算进去,再决定扩大预算。
下一轮真正值得追踪的变量,是这些计量接口能否与缺陷、周期和业务结果接通,以及连接真实应用的代理能否在失败时把状态讲清楚。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel