
AI 编程与应用日报:Cursor 自动路由模型,OpenAI Presence 推进企业代理生产
7 月 22 日的更新把模型路由、Copilot 采用深度、企业代理治理、流程自动化和 AI 使用数据查询推进到可操作入口,本文整理其开放范围与厂商口径限制。
先看结论
7 月 22 日的几项更新,把 AI 编程和企业代理的工作面往前推了一步:Cursor 开始替团队决定每个请求该交给哪个模型,GitHub 把 Copilot 的使用阶段和 Pull Request 指标放进同一张管理视图,OpenAI Presence 把语音与聊天代理包装成带权限、评测和人工升级的企业产品,Vertesia 则把代理调度、浏览器操作、流程测试和 MCP 接口放到同一套平台里。Anthropic 还把 Economic Index 做成 Claude 里的可查询连接器。
这组变化的共同点不是模型又多了几个,而是代理开始被当作一条需要配置、测量和复盘的工作流。下面的 5 条均来自 7 月 22 日官方发布;厂商自测、客户案例和产品演示分别标注,不混写成行业平均结果。
| 更新 | 发生了什么 | 影响谁 | 当前状态与下一步 |
|---|---|---|---|
| Cursor Router | 按请求内容、上下文、任务复杂度和领域自动选择模型,提供 Intelligence、Balance、Cost 三种模式。1 | 使用多个模型、需要控制编码成本的 Teams 与 Enterprise 团队 | 已面向 Teams 和 Enterprise 开放,覆盖桌面端、Web、iOS、CLI 和 SDK。先用自己的任务集比较固定模型与自动路由的每次成功成本。 |
| GitHub Copilot 影响仪表盘 | 把 Code-first、Agent-first、Multi-agent / Copilot app 和未活跃用户分成 cohort,同时展示 PR 合并、合并速度、用户数、占比和日均代码行数。2 | 企业管理员、组织所有者和负责推广 Copilot 的工程效能团队 | 已向有 Copilot usage metrics 权限的企业管理员和组织所有者提供;采用 28 天滚动窗口,指标适合做跟踪和分组,不足以单独证明生产率因果。 |
| OpenAI Presence | 为语音和聊天代理提供政策、护栏、批准动作、模拟测试、评测工具、升级规则和 Codex 驱动的改进流程。3 | 客服、销售和高风险内部流程的企业团队 | 面向符合条件的企业有限开放,由 OpenAI FDE 和系统集成商参与部署,不是自助式产品。 |
| Vertesia 平台更新 | 新增 Studio Assistant、定时代理、云端 Agentic Browsing、可从流程图或文档生成并测试的 Process Engine,以及供 Claude Code 和 Codex 使用的远程 MCP。4 | 需要把业务流程、无 API 网站和编码代理接在一起的企业团队 | 7 月 22 日由 Vertesia 发布;网页测试和自主调度效果属于供应商演示,落地前要单独验收身份、权限、审计和失败恢复。 |
| Anthropic Economic Index connector | 在 Claude 中直接查询 Economic Index,支持按职业、地区和任务追问,并要求模型回到基础数据。5 | 做行业研究、产品规划或 AI 使用分析的读者 | claude.ai 今日可用,无需安装;数据反映 Claude 使用模式,不代表整个劳动力市场。 |
Cursor:模型选择开始变成团队策略
Cursor Router 的核心不是再提供一个模型,而是在请求执行前增加一个分类器。Cursor 称它用 60 万条以上的实时请求训练路由器,再在数百万条线上请求上做 A/B 测试;分类依据包括 query、上下文、任务复杂度、领域和模型表现。简单任务交给更便宜的模型,界面调整交给它认为更适合的模型,长时程任务再转给前沿推理模型。1
团队可以在 Auto 模式下选择 Intelligence、Balance 或 Cost。Cursor 披露,早期访问中的 3 个高用量账户、数千名用户,在自动路由请求上的成本比全部使用 Opus 4.8 低 30% 至 50%;线上测试还给出了约 60% 的节省数字。这些数字来自 Cursor 自己的模型池、任务分布和评价方法,不能直接当作其他团队的预算预测。1
Cursor 同时使用用户满意度和 keep rate 评价结果,后者指代理生成的代码经过一段时间后仍留在代码库中的比例。这个指标组合比只看 token 单价更接近工程结果,但它仍然受任务选择、代码审查习惯和团队工作流影响。试用时,可以先固定一组真实任务,比较固定模型与 Router 的成功率、人工修正次数、保留代码比例、缓存未命中成本和每个已接受提交的成本。
GitHub:从活跃人数转向采用深度
GitHub 的新仪表盘建立在此前 Copilot usage metrics API 的 AI adoption phase 分类之上。它用 28 天滚动窗口观察用户使用过哪些 Copilot 表面:Phase 1 是 Code-first,Phase 2 是使用单个 GitHub 代理入口的 Agent-first,Phase 3 则要求使用两个或以上代理入口,或使用 GitHub Copilot app。仪表盘另外保留了已授权但未参与的 Passive 用户。2 6
新增视图把每个 cohort 的用户数、整体占比、每用户每月合并的 Pull Request 数量、Pull Request 合并速度中位数和每用户日均代码行数放在一起,还提供 6 个月的 cohort 增长和 PR 吞吐趋势,以及推动用户进入更深采用阶段的建议。企业管理员因此可以回答「哪些团队还停留在补全」和「哪些团队已经在使用代理入口」,不必只看一个 license 活跃率。2
但仪表盘里的 adoption multiplier 仍是比较信号,不是因果实验。活跃用户与 Passive 用户的 PR 表现差异,可能来自团队组成、项目类型、资历和任务难度。工程效能团队可以用它找培训和 rollout 对象,不能只凭这张图宣布「Copilot 让团队提速了」。要评估投入回报,至少还要保留上线前基线、相似团队对照和代码质量指标。
OpenAI Presence:生产代理的边界被写进产品
OpenAI Presence 面向客服、销售和高风险内部流程,支持语音与聊天代理。每次部署从一个具体工作开始,例如处理账单、保险理赔或员工 IT 请求;企业决定代理能访问哪些知识和系统、哪些动作需要审批、何时必须交给人工。Presence 把操作权限、标准流程、护栏、模拟测试、评测工具和升级规则放在同一套产品里,发布后再用生产会话和人工升级记录发现缺口,由 Codex 提议修改,团队测试后再批准上线。3
OpenAI 披露,其英语电话支持渠道目前有 75% 的来电无需人工介入,Codex 驱动的改进循环在 10 天内把人工交接比例降低了 15 个百分点。这是 OpenAI 自己的支持场景结果,不是面向客户的独立基准。BBVA、SoftBank 和 IAG 在公告中被列为探索或测试 Presence 的企业,原文没有把它们写成已经完成规模化部署。3
Presence 当前是面向符合条件企业的有限 general availability,由 OpenAI Forward Deployed Engineers 和选定的全球系统集成商参与,尚未提供自助式购买入口。对要评估这类产品的团队,第一轮不该从「能不能回答问题」开始,而应先列出工具权限矩阵、需要审批的动作、边界案例测试集、人工升级条件和版本回滚方式。
Vertesia:代理开始接手没有 API 的流程
Vertesia 的 Studio Assistant 允许用户用自然语言描述目标,由助手生成提示词、用不同模型测试、根据执行结果调整后再发布代理。Agent Scheduler 可以让代理按日、周、月或自定义间隔运行,代理也能在对话中创建后续计划;运行时使用用户的身份、权限和工具,平台提供执行观察与分析。4
另一个变化是 Agentic Browsing。Vertesia 试图让代理在没有 API 的政府门户、旧式供应商平台和动态网页上完成操作,并将浏览器运行隔离在云端。公司用 BMW 配置器和 Google Trends 做了演示,还提到代理可以代用户处理需要多因素认证的网站。网页会变、登录会过期、权限也可能超出预期,所以这些演示只能证明产品方向,不能替代真实业务环境的安全测试。4
Process Engine 则把流程图、过程文档、技术配置或对话转换成可交互的工作流,并让代理先跑过每个步骤和可能的组合,再决定是否发布。Vertesia 还开放远程 MCP,让 Claude Code 或 Codex 可以直接在平台项目上创建原本需要进入 Studio 才能完成的内容。这里最值得核对的是确定性步骤和代理步骤的分界:贷款审批、合同审查、事前授权等流程,应该把身份校验、金额阈值和最终批准保留为可审计的人工或规则动作。
Anthropic:把行业使用数据放进对话入口
Anthropic Economic Index connector 让 Claude 直接查询 Economic Index。用户可以问哪些职业使用 AI 较多、某个地区如何使用 Claude,或过去一年哪些任务的自动化方式发生变化,模型还可以把回答指回底层数据。连接器在 claude.ai 的 connectors 菜单中启用,官方称任何 Claude 模型都能使用,无需安装。5
它的实用价值在于降低了查表和筛选数据的门槛,产品经理或研究人员可以先用自然语言定位问题,再回到底层数据确认口径。不过 Anthropic 明确提醒,Economic Index 记录的是 Claude 的使用模式,不等于整个劳动力市场。用它判断行业趋势时,应把它当作一个供应商数据集,而不是全行业普查;做团队决策还需要补充自己的使用日志、访谈或业务数据。5
给工程团队的检查清单
- 给路由器设一个真实基线。 用同一批任务比较固定模型和自动路由,记录已接受提交的成本、人工修正、代码保留率和缓存影响,不要只比较 token 单价。
- 把 Copilot adoption 当作分组工具。 先用 cohort 找到培训、权限和 rollout 的重点,再用质量、周期和对照组验证是否真的产生改善。
- 把生产代理拆成权限和动作。 为每个工具调用标记只读、可写、需审批和禁止执行,给高风险动作保留人工升级和回滚路径。
- 对浏览器代理做失败测试。 覆盖登录过期、页面改版、MFA、重复提交、网络中断和权限不足,不能把一次成功演示当作稳定性结论。
- 给连接器数据保留原始口径。 Anthropic Economic Index 可以帮助定位问题,但回答引用的样本范围和数据限制要跟着结论一起记录。
7 月 22 日的更新把几件事连在了一起:模型选择可以自动化,代理采用可以分 cohort 观察,企业动作可以放进审批和评测流程,业务数据也开始通过对话入口被查询。真正需要验收的字段,已经从「模型能不能生成结果」扩展到「它用了什么权限、花了多少钱、结果是否被保留、出了问题谁能接管」。
Contenido relacionado
- Inicia sesión para comentar.
