
AI 编程情报:Sonnet 5、JetBrains 代理与评测飞轮
本期聚焦 6 月 30 日前后的 AI 编程与应用进展:Claude Sonnet 5 进入 Claude 与 GitHub Copilot,Copilot Agent 接入 JetBrains AI Assistant,Google 推出 ADK for Go 2.0 与代理评测飞轮,Anthropic 发布 Claude Science 科研工作台。
过去一天的 AI 编程进展集中在三个可执行层:更便宜的强代理模型、进入 IDE 与团队工具的代理入口、以及把「代理好不好用」变成可重复评测的工程系统。Anthropic 发布 Claude Sonnet 5,GitHub 同步把它接入 Copilot;GitHub 与 JetBrains 又把 Copilot Agent 放进 JetBrains AI Assistant 的代理选择器;Google 则把代理工作流和评测飞轮推给开发者。12345
| 信号 | 发生了什么 | 影响对象 | 下一步看点 |
|---|---|---|---|
| Sonnet 级模型继续下探成本 | Anthropic 称 Claude Sonnet 5 面向更强代理任务,在 Claude Code 与 Claude Platform 可用,并给出 8 月 31 日前每百万输入 token 2 美元、输出 token 10 美元的介绍价。1 | 使用 Claude Code、Claude API 或多模型路由的团队 | 用本团队真实任务测「更低成本是否仍能完成长任务」,不要只看发布方 benchmark。 |
| Copilot 增加 Sonnet 5 选项 | GitHub 表示 Claude Sonnet 5 已面向 Copilot Pro、Pro+、Max、Business、Enterprise 用户逐步开放,可在 VS Code、Visual Studio、Copilot CLI、GitHub Copilot cloud agent、GitHub Mobile、JetBrains、Xcode、Eclipse 等入口选择。2 | 已购买 Copilot 的个人与企业团队 | 管理员需要检查模型策略、计费口径和数据保留要求。 |
| JetBrains 里的代理入口升级 | GitHub Copilot 现在是 JetBrains AI Assistant 代理选择器中的一等选项,可选 Copilot 模型、调节推理深度,并把多步骤编码任务交给代理处理。3 | JetBrains IDE 用户、混用 JetBrains AI Assistant 与 Copilot 的团队 | 关注后续 NES、Skills 与更深工具编排是否能减少 IDE 间来回切换。 |
| 代理应用开始「图式编排」 | Google 发布 ADK for Go 2.0,新增图式工作流引擎、内置人工确认、动态编排和统一节点运行时;其核心表述是「图也是一个 agent」。4 | 用 Go 构建生产代理应用的后端团队 | 把分支、并发、暂停恢复和人工审批从临时控制流升级为显式工作流。 |
| 代理评测从「感觉变好」转向闭环 | Google 的 quality flywheel skill 把准备数据、运行推理、评分、失败分析、优化迭代串成循环,并强调优化器不能给自己的结果打分。5 | 做自研 agent、RAG agent 或企业内部工具的工程团队 | 重点不只是引入评分,而是把失败聚类、基线对比和人工批准接进发布流程。 |
| 领域工作台继续出现 | Anthropic 发布 Claude Science beta,面向科研工作流集成常用工具、可审计产物、计算资源和 60 多个科学数据库 / 技能 / 连接器,并在输出中加入 reviewer agent 检查引用和计算。6 | 科研、生命科学与企业研发团队 | 看它能否在敏感数据、可复现计算和专家复核之间找到可采购的平衡。 |
模型层:强代理能力正在从旗舰款向日常款扩散
Anthropic 对 Sonnet 5 的定位很明确:它不是只面向聊天的中档模型,而是要把更强的计划、工具使用、编码和知识工作能力下放到 Sonnet 级别。官方称 Sonnet 5 接近 Opus 4.8 的部分能力,但价格更低;介绍价结束后,API 定价将变为每百万输入 token 3 美元、输出 token 15 美元。1
对工程团队来说,真正有用的不是「更聪明」这个词,而是两件可测试的事:第一,Sonnet 5 能否在你们的真实仓库里减少中途停摆;第二,它是否能把原本只敢交给更贵模型的任务,下放到更可控的成本区间。Anthropic 的客户引语显示,早期测试方看重的是多步骤软件工程、调试、验证和遵循约定的能力;这仍属于厂商与合作伙伴口径,应该用自己的历史任务复核。1
GitHub 的同步接入让这个模型变化更快进入日常开发面板。Sonnet 5 在 Copilot 中按 Usage Based Billing 计费,企业与商业版管理员可通过模型策略开启;GitHub 还特别说明,和其他 Sonnet 模型一样,Copilot 内的 Claude Sonnet 5 采用 Zero Data Retention。2
入口层:代理不只在独立 App 里等命令
GitHub 与 JetBrains 的更新说明了一个清晰方向:代理入口会贴近开发者已经打开的工具。开发者在 JetBrains AI Assistant 的聊天界面中选择 GitHub Copilot 后,可以把多步骤任务交给 Copilot,让它理解项目、提出修改、运行命令并迭代。3
这类整合的关键不是「多了一个按钮」,而是上下文归属变了。过去很多团队在 IDE、终端、Web 版代理和项目管理工具之间复制问题;现在供应商都在争夺「任务被提出的那一刻」。GitHub 预告的 Next Edit Suggestions、Skills 和更深工具编排,也指向同一件事:让代理既能理解当前编辑现场,也能调用复用能力完成更长链条。3
工程层:评测和编排成为代理产品的基础设施
Google 的 ADK for Go 2.0 把生产代理的常见难点拆得比较实在:真实 agent 应用会分类、分支、并发、请求人工批准、失败重试、循环直到完成。它把这些行为表达为图节点和边,由调度器处理并发、状态持久化、暂停与恢复。4
这对后端团队的含义是,代理编排不应该长期停留在「一堆 if-else + prompt 拼接」。如果任务有审批、重试、并发专家代理、人工补输入或跨进程恢复,显式工作流比临时脚本更容易审计,也更容易定位一次失败到底发生在哪个节点。ADK 2.0 还把 human-in-the-loop 做成内置原语,节点可以暂停并等待人类回应,后续再恢复执行。4
同一天,Google 还发布面向 coding agent 的 quality flywheel skill。它把评价拆成五步:准备评测数据、运行代理生成 traces、用 AutoRaters 或自定义指标评分、分析失败、优化后与基线对比。这里最值得抄作业的一条原则是:提出修复的优化器和给修复打分的评估器必须解耦,否则系统会学会迎合指标。5
Google 的案例也提醒,通用评分并不总能暴露你最关心的失败。它在旅行规划 agent 示例中,为「用户中途修改后是否被最终方案采纳」单独做了
revision_honored 指标,才把失败从混合分数中拆出来。对企业 agent 来说,这比单纯追求一个高分更重要:客服 agent、报销 agent、代码 agent 各自最怕的失败不同,指标也应该不同。5应用层:领域代理开始要求可审计产物
Claude Science 值得单独看,不是因为「科研」这个垂直领域本身,而是因为它把领域代理的采购问题说得更清楚:科研人员不只需要聊天,还需要数据、代码、图表、计算环境、引用检查和可复现实验记录。Anthropic 称 Claude Science 可以在本机、远程机器、HPC 登录节点或 Modal 计算资源上工作,并生成带代码、环境和消息历史的可审计产物。6
它还把 reviewer agent 放进流程,用于检查引用、不可追溯数字和图表是否与代码一致。这个设计比「能写论文草稿」更接近真实组织的要求:结果能不能复核,敏感数据是否留在原基础设施中,专家能否在关键步骤前批准或撤销决策。6
对读者的直接判断
- 如果你负责开发者工具选型:本周应把 Sonnet 5 加进真实任务回放,而不是只看模型榜单。重点记录完成率、人工接管点、每个任务成本和失败类型。
- 如果你在做自研 agent:评测指标要从业务风险倒推。一个统一总分很容易掩盖「用户修改未被采纳」「最终回答与内部状态矛盾」「工具调用成功但用户结果错误」这类高风险问题。
- 如果你在企业里推动 AI 应用落地:不要只问「能不能自动完成」。更该问:能否暂停等人批准,能否恢复,能否解释每一步的依据,能否在发布前用基线数据证明没有回退。
- 如果你关注 AI 编程行业竞争:今天的焦点不是单个 IDE 谁多一个模型,而是代理能力正在被拆成模型、入口、编排、评测、治理五层;未来的差异会出现在这些层之间的闭环速度。
参考来源
- 1Introducing Claude Sonnet 5
- 2Claude Sonnet 5 is generally available for GitHub Copilot - GitHub Changelog
- 3Copilot Agent is now available in JetBrains AI Assistant - GitHub Changelog
- 4ADK for Go 2.0: build agent workflows as a graph
- 5Driving the Agent Quality Flywheel from Your Coding Agent
- 6Claude Science, an AI workbench for scientists, is now available
相似内容
- 登录后可发表评论。
