
AI 编程情报:办公代理、预算控制与持久工作流
本期聚焦 7 月中旬 AI 编程与应用更新:ChatGPT Work 和 Claude Cowork 把代理推向跨应用长任务,Copilot 继续补 JetBrains、仓库概览和预算控制,Cursor Grok 4.5 与 Google Genkit 则分别指向自研模型和持久工作流开发栈。
7 月 9 日到 10 日的几条更新,把 AI 编程和 AI 办公代理推到了同一个问题上:模型和入口已经足够多,下一步要补的是权限、预算、持久状态和可回看的工作记录。OpenAI 把 Codex 并入新的 ChatGPT 桌面应用,GitHub 在 JetBrains、仓库首页和预算 API 继续扩 Copilot 控制面,Google Genkit 则把持久会话、人工审批和长任务恢复做成开发框架能力。123
| 信号 | 发生了什么 | 影响对象 | 下一步看点 |
|---|---|---|---|
| ChatGPT Work 扩到跨应用工作流 | OpenAI 发布 ChatGPT Work,称它能跨应用和文件收集信息,生成 sheets、slides、docs 和 web apps;Codex 每周使用人数超过 500 万,其中超过 100 万用于软件开发之外的工作。1 | 用 ChatGPT/Codex 做办公自动化、分析和开发任务的团队 | 关注插件权限、审批动作、桌面本地文件访问和费用控制。 |
| Microsoft 365 Copilot 接入 GPT-5.6 | OpenAI 称 GPT-5.6 将成为 Microsoft 365 Copilot 在 Word、Excel、PowerPoint、Chat 和 Cowork 中的 preferred model。4 | 已部署 Microsoft 365 Copilot 的企业 | 评估输出质量提升是否带来更高 token 成本,尤其是 Excel 分析和跨部门 Cowork。 |
| Copilot JetBrains 插件接入 Codex provider | GitHub 在 7 月 7 日更新中把 Codex 作为 JetBrains IDE 的 agent provider 公测,同时加入 hooks、MCP server 管理、CLI approval settings、Claude agent permission modes 和 custom model support。2 | JetBrains 用户、Copilot Business/Enterprise 管理员 | IDE 里的代理选择不再只是换模型,而是换审批、工具和组织策略。 |
| Copilot 仓库概览进入 github.com | GitHub 让 Copilot 为首次访问的仓库生成高层 overview,返回仓库用途、技术栈和贡献指南;没有 README 的仓库也可让 Copilot 生成 README。5 | 开源维护者、新加入项目的工程师 | 这会降低读陌生仓库的门槛,也会把 README 和贡献文档质量暴露给更多人。 |
| Copilot 预算 API 补 per-user 状态 | GitHub 新增 REST API endpoint,可分页拉取 multi-user budget 下每个用户的消耗、限额、使用比例和 individual override。6 | 企业 owner、billing manager、平台工程团队 | 大规模 Copilot 试点开始进入按人控费阶段,预算接近上限的人能被更快找出来。 |
| Cursor 发布 Grok 4.5 | Cursor 称 Grok 4.5 是与 SpaceXAI 联合训练的 MoE 模型,覆盖软件工程、数据科学、金融和法律等长任务;在 Cursor 桌面、Web、iOS、CLI 和 SDK 中可用,基础模型标价为每百万输入 2 美元、输出 6 美元,fast variant 为每百万输入 4 美元、输出 18 美元。7 | Cursor 个人和团队用户、关注自研模型的开发工具团队 | 注意其自报 benchmark 边界,尤其是 CursorBench 中旧 Cursor 代码快照曾进入训练数据这一披露。 |
| Claude Cowork 扩到 Web 和移动端 | Anthropic release notes 显示,Claude Cowork 从桌面扩到 Web 和移动端,远程会话和文件保存到 Claude 账号,关闭电脑后工作可继续,scheduled tasks 不要求设备在线。<MarkdownCitation index="8" title="Release notes | Claude Help Center" url="https://docs.anthropic.com/en/release-notes/claude-apps" /> | Claude Max 起步用户、需要移动端遥控长任务的团队 |
| Google Genkit 推 Agents API | Google Developers Blog 称 Genkit Agents API 在 TypeScript 和 Go 中 preview,支持 server-managed state、snapshot 分支、HTTP agent route、远程客户端、人工审批、长任务 detach/poll 和 specialist delegation。3 | 正在把 agent 做进自有应用的工程团队 | 对照自研 agent 是否已经处理会话持久化、人工审批、长任务恢复和前后端协议。 |
办公代理:ChatGPT、Microsoft 365 和 Claude 都在争「跨应用长任务」
OpenAI 对 ChatGPT Work 的描述已经不是聊天产品,而是能跨文件、应用和插件完成材料生产的工作代理。它可以把客户研究变成 campaign brief,再产出营销资产并按市场改写;也可以用 Scheduled Tasks 监控 Slack、Teams、邮件、网站和 dashboard 的变化,再更新文档或 slides。1
这类能力的技术入口在桌面端最明显。OpenAI 称 Codex app 从 7 月 9 日开始并入新的 ChatGPT desktop app,Codex 仍保留开发者工作流,并新增 diff 内联编辑、侧边栏 pull request review、更快的 computer use,以及一个项目支持多个 repositories。桌面端还加入 built-in browser 和 Computer Use,用于访问网页、本地文件和应用。1
微软这边的信号更直接:GPT-5.6 会进入 Microsoft 365 Copilot 的 Word、Excel、PowerPoint、Chat 和 Cowork。OpenAI 的官方稿把它放在「每个 token 产出更多有用工作」的口径下,重点是更少提示轮次、更深 Excel 分析、更成形的 PowerPoint 输出和跨团队 Cowork。4
Anthropic 的 Claude Cowork 更新则把同类问题推到移动端。Claude Cowork 现在可在 Web 和移动端使用,远程会话保存在 Claude 账号里,工作在关闭电脑后继续,scheduled tasks 不要求设备在线。它同一天还扩展了 Microsoft 365 connector 的 write tools,可草拟、发送和整理邮件,管理日历,更新 mailbox settings,并创建或更新 OneDrive 和 SharePoint 文件;Teams 仍是只读。8
这里的共同点不是「办公软件更聪明」,而是代理开始拥有更长的时间跨度和更多写权限。对企业来说,真正要提前想清楚的是哪些动作必须审批,哪些 connector 只能读不能写,哪些任务可以离线继续跑,以及日志和文件最终留在哪个系统里。
编程入口:Copilot 在 JetBrains 和 GitHub 页面继续贴近开发动作
GitHub 的 JetBrains 更新把 Codex 做成 Copilot Chat 里的 agent provider。开发者需要先安装 Codex CLI,再在 JetBrains 设置里启用 Codex 并配置 CLI 路径;Business 和 Enterprise 用户还需要管理员开启 editor preview features policy。2
同一更新更值得看的是控制面。GitHub 把 hooks 管理放进 Agent Customizations,Copilot CLI sessions 可以直接管理 MCP servers,支持 command 和 HTTP 两类 server,也支持 workspace-level
.github/mcp.json。Copilot CLI sessions 新增 Default Approvals、Bypass Approvals 和 Autopilot 三档;Claude agent sessions 也有 permission modes 和 debug logs。2GitHub 还把 Copilot 放进仓库首页。首次探索一个陌生仓库时,Copilot 可以生成高层 overview,总结仓库目的、使用的技术和贡献指南;如果仓库没有 README,它也能生成一个。这个功能对新成员 onboarding 有用,但也会让仓库文档从「有没有」变成「是否足以让代理正确解释项目」。5
Cursor 这边的更新集中在模型供给。Grok 4.5 是 Cursor 与 SpaceXAI 联合训练的 MoE 模型,Cursor 称训练数据包含 trillions of tokens 的 Cursor 数据,覆盖真实代码库和开发者-代理交互。它没有只做 coding specialist,而是扩大到 STEM、research papers 和其他 knowledge work。7
价格也值得单独记下。Grok 4.5 基础模型标价为每百万输入 2 美元、输出 6 美元,fast variant 为每百万输入 4 美元、输出 18 美元;Cursor 个人和团队订阅包含模型使用,首周 double usage。Cursor 同时披露,Grok 4.5 在 CursorBench 上有优势,因为一个较早 Cursor codebase snapshot 曾意外进入训练数据,影响不明确,相关数据已为未来模型移除。7
这说明 AI 编程工具的竞争正在分两层走:一层是 IDE 里能不能接更多 agent provider 和工具,另一层是厂商自研模型能不能用真实开发轨迹训练出更长任务能力。前者考验产品入口,后者考验数据、评测和成本控制。
治理和成本:预算 API、使用指标和管理员开关变成主功能
GitHub 7 月 10 日的预算 API 更新很小,但对企业试点很实用。Enterprise owners 和 billing managers 现在可以通过一个 REST API endpoint 分页查看 multi-user budget 下每个用户的消耗和限额,按使用比例过滤,按消耗排序,也能看到 individual budget override。此前要逐个用户查询。6
GitHub 7 月 2 日还修正了 Copilot usage metrics API 的覆盖口径:Copilot CLI 从 1.0.57 起上报 suggested lines of code,1.0.64 起对 suggested 和 accepted edits 去重;仅通过 server-side telemetry 可见的用户现在会出现在
totals_by_ide,部分 AI credit 消耗也被重新归属到正确组织或企业。9Kimi K2.7 Code 的 Copilot 更新也落在治理边界上。GitHub 称它是 Copilot model picker 里的第一个 open-weight model,已对 Business 和 Enterprise 开放,但默认关闭,管理员必须在 Copilot settings 里开启 Kimi K2.7 Code policy;GitHub 建议管理员按自身安全、合规和数据治理要求评估 open-weight models。10
这些不是边角功能。代理使用一旦扩到 IDE、CLI、云端 agent 和桌面应用,企业最先失控的通常不是模型效果,而是「谁用了多少」「哪些模型被允许」「工具调用是否需要审批」「预算快到上限的人是谁」。GitHub 这组更新把这些问题搬进 API 和管理员开关里,说明 Copilot 正在从个人效率工具变成可计量的企业服务。
应用框架:Genkit 把持久会话、审批和长任务恢复放进开发栈
Google 的 Genkit Agents API 面向的是另一类读者:不是买现成办公代理,而是在自己的应用里做 agent。Genkit 现在提供同一个
chat() 接口,既能本地运行,也能放到 HTTP endpoint 后面;Agents API 在 TypeScript 和 Go 中 preview,Google 明确提醒 minor version 可能引入 breaking changes。3它解决的都是开发者重复造轮子的部分。server-managed state 会把 messages、custom state 和 artifacts 作为 snapshots 存起来,客户端只带 session ID;也可以用 snapshot ID 从某个状态分支。远程客户端使用同一套 wire protocol,流式返回文本、custom state 或 artifact。3
审批和长任务也内置进去。Genkit 的 interruptible tool 可以在支付、部署或危险 shell 命令前暂停,让用户 approve、reject 或补充输入;server-managed state 还支持 detach 长任务,关闭标签页后用 snapshot ID 轮询、等待或 abort。对长研究、多步骤计划和工具密集型流程,这比自己拼一个任务队列更接近应用层需求。3
Genkit 和 Google ADK 的分工也讲得比较清楚。Genkit agents 是 full-stack user-facing app 里的应用 primitive;如果整个系统就是复杂多代理拓扑,或需要 managed runtime、hosting、scaling 和 managed sessions,Google 建议考虑 ADK。3
这对自研 agent 团队是一个检查清单:会话状态放哪里,用户审批怎么恢复,长任务断线后怎么继续,artifact 怎么版本化,多个 specialist 的输出如何合并。框架没有替你解决业务判断,但把工程底座的问题摆到了明面上。
对读者的直接判断
- 如果你负责企业 AI 工具采购,今天的重点不只是 GPT-5.6 或 Grok 4.5 谁更强。先把模型权限、费用上限、connector 写权限和动作审批列成表,再决定开放给哪些团队。
- 如果你在推 Copilot,JetBrains provider、仓库 overview、usage metrics 和 budget API 应该一起看。入口越多,越需要统一的使用数据和预算规则。
- 如果你在做自研 agent,Genkit 这次更新值得按功能逐项对照。持久状态、人工审批、长任务恢复和前后端协议不是锦上添花,是真实应用迟早会碰到的基础问题。
- 如果你关注 Cursor,Grok 4.5 的重点是「开发者-代理交互数据」开始成为模型训练资产。它的价格和 benchmark 披露同样重要,尤其是 CursorBench 训练污染这一点,评测结果不能只看榜单数字。
参考来源
- 1ChatGPT is now a partner for your most ambitious work
- 2Codex as agent provider and agentic enhancements in JetBrains IDEs - GitHub Changelog
- 3Build agentic full-stack apps with Genkit
- 4GPT-5.6 is now the preferred model in Microsoft 365 Copilot
- 5Ask Copilot for a repository overview - GitHub Changelog
- 6Per-user states for multi-user budgets in the REST API - GitHub Changelog
- 7Introducing Grok 4.5 · Cursor
- 8Release notes | Claude Help Center
- 9Improved accuracy and coverage in Copilot usage metrics reports - GitHub Changelog
- 10Kimi K2.7 now available for Copilot Business and Enterprise - GitHub Changelog
相似内容
- 登录后可发表评论。
