
AI 编程与应用日报:GitHub Models 退役,代理开始受设备、身份与沙箱约束
7 月 30 日至 31 日清晨,GitHub 撤下 Models 并更新 Copilot 代理工作台,Anthropic、Google 等则补上评测隔离、沙箱成本和数据库身份控制。
先看结论
过去 24 小时的更新,把 AI 编程和应用系统的边界又往前推了一步:IDE 开始同时管理多个代理会话,GitHub 直接撤下模型试验入口,远程控制要按设备和身份收紧;代理运行本身则转向沙箱、数据库群组认证和评测环境隔离。模型能力仍然重要,但团队真正要接住的是入口变化、权限变化和运行成本。
| 更新 | 北京时间 | 发生了什么 | 读者先看什么 |
|---|---|---|---|
| VS Code Copilot 7 月汇总 | 7 月 30 日 16:00 | Agents window 支持多会话、worktree、子代理跟踪;Copilot vision 正式可用 | 代理是否能在隔离 worktree 中并行,审查责任如何分配 |
| Visual Studio Copilot 7 月更新 | 7 月 30 日 23:01 | 新 Agent 仍为预览,增加 .NET/Azure 内置技能和选中代码审查 | 预览能力是否适合进入团队默认工作流 |
| GitHub Models 退役 | 7 月 31 日 03:14 | Playground、模型目录、推理 API 和 BYOK 全部停止 | 依赖 GitHub Models 的实验和脚本要迁移到哪里 |
| Copilot 远程控制设备策略 | 7 月 30 日 22:54 | 企业可以按 SSO、设备或文件策略限制远程控制 | 移动端和远程会话是否只在受管设备上开放 |
| GPT-5.6 价格与 Fast mode | 7 月 30 日 | Luna、Terra 调整 API 价格,Sol 增加更快的 Fast mode | 重新计算高吞吐代理的模型分层和预算 |
| Anthropic 评测事故披露 | 7 月 30 日 | 三次评测运行因错误联网接触真实组织系统 | 第三方评测环境是否真的断网、隔离、可监控 |
| GKE Agent Sandbox | 7 月 30 日 | Google 用 gVisor 和编排机制提高代理密度,给出最高降本 75% 的测试结果 | 先核对工作负载的空闲期、延迟和突发唤醒模式 |
| AlloyDB 群组认证 | 7 月 30 日 | 预览版把 Google Groups 身份传递到数据库授权和审计 | 代理是否仍在使用共享账号,能否追溯到具体用户 |
| Gemini Robotics ER 2 | 7 月 30 日 | 通过 Gemini API 和 AI Studio 提供机器人高层推理与多机器人协作 | 需要自己补齐底层运动控制,企业入口仍是私有预览 |
IDE 里的代理开始像一个并行工作台
GitHub 的 VS Code 7 月更新把 Agents window 做成了多会话工作区。它支持把 Copilot、Claude 或 Codex 会话放进 Git worktree,让每个代理使用仓库的隔离副本;用户还能查看子代理正在使用的模型、耗时和工具调用,并在同一界面处理失败的 CI 检查和新的 PR 评论。Agents window 仍是公开预览,Copilot vision 则已经正式可用,可以把图片和 PDF 加入聊天。1
这组变化解决的不是「模型能不能写代码」,而是多个任务如何并行、怎样查看变更、谁来接住失败任务。对团队而言,worktree 隔离比「同时开几个聊天窗口」更有工程意义:它降低了代理互相覆盖文件的风险,但也要求团队明确合并顺序、测试环境和子代理的权限边界。GitHub 还把 Claude 的多聊天会话、BYOK 模型接入 Agents window,以及用
! 前缀运行终端命令放进同一轮更新;这些功能的开放状态并不完全相同,不能把整张更新表都当成 GA 能力。1Visual Studio 的更新更靠近 .NET 和 Azure 团队。Copilot Chat 增加基于 GitHub Copilot SDK 的 Agent(预览),并提供由 .NET、Azure 团队编写的内置技能;选中代码后可以直接发起 Review Selection,组织所有者也能为组织仓库设置自定义指令。新 Agent、内置技能和选中代码审查面向所有计划开放,但内置技能默认关闭且依赖对应 workload,组织级指令只适用于 Business 和 Enterprise。2
GitHub 同日把 stacked pull requests(堆叠式 PR)开放为公开预览:一个大改动可以拆成按顺序依赖的小 PR,让代理或开发者逐层提交、逐层审查。GitHub.com、CLI 和移动端已经可以使用,面向所有仓库逐步开放;merge queue 对 stacked PR 的支持还要继续推出。对代理工作流来说,这提供了比「一个代理提交一个巨型 PR」更细的审查颗粒度,但在 merge queue 完整可用前,团队仍要自己管理堆叠关系。3
GitHub Models 退役,模型入口不再是默认资产
GitHub Models 已于 7 月 30 日完成退役:Playground、模型目录、推理 API 和 BYOK 对现有客户也不再可用。GitHub 给出的替代方向是 Microsoft Foundry 的模型目录,或通过 GitHub Copilot 访问模型;这不是功能小改,而是依赖该入口的实验、教程和脚本需要迁移。4
这条消息对开发者的提醒很直接:模型试验入口也有生命周期。凡是把 GitHub Models endpoint、模型目录或 BYOK 流程写死在内部工具里的团队,都应先盘点调用位置,再决定迁移到 Foundry、直接使用模型厂商 API,还是换成 Copilot 入口。GitHub 的公告没有给出自动迁移方案,因此不能假设现有请求会平滑切换。
OpenAI 则从价格和速度两端重新切 GPT-5.6 的 API 层级。官方文章给出的新价格是:Terra 输入每百万 token 2 美元、输出 12 美元;Luna 输入 0.20 美元、输出 1.20 美元;Sol 价格不变,但 API 新增 Fast mode,最高可比 Standard 快 2.5 倍,价格为两倍。Terra 和 Luna 可用于 ChatGPT Work、Codex 和 API,免费与 Go 用户可使用 Terra,Plus、Pro、Business、Enterprise 用户可选择 Terra 和 Luna。5
OpenAI 同文列出的 Notion、Blitzy 和 Dust 数据是客户或厂商案例口径,不能当成普遍成本曲线。工程上更值得重算的是任务分层:低风险、高吞吐的摘要、分类和工具编排是否适合 Luna;需要更稳定推理的日常工作是否放到 Terra;只有在延迟本身有明确商业价值时,Fast mode 的两倍价格才可能合理。上期已经提到 GPT-5.6 的服务效率变化,这一次新增的重点是价格、速度和可用范围,不重复把厂商工程数据当作独立 benchmark。
远程代理和评测环境都暴露出同一个问题:实际权限不能靠说明文字保证
GitHub 为 Copilot 远程控制增加
remoteControl 企业托管设置。管理员可以设为 requireSSO,要求特定组织通过单点登录;也可以设为 disabled 完全阻断,或设为 enabled 不加设备限制。策略可以由企业私有仓库、MDM 或文件下发,并与原有的远程控制总开关叠加,形成从企业到单设备的分层限制。6这比单纯增加一个「允许远程控制」开关更接近企业实际:同一个代理能力,在受管工作机、个人电脑和移动设备上的风险并不相同。启用前至少要把组织范围、设备状态、SSO 条件和可接触的仓库分开写进策略;否则「远程控制已开启」会成为一个过于宽泛的权限。
Anthropic 披露的网络安全评测事故,则说明测试环境的边界也不能只写在 prompt 里。Anthropic 回顾了 141,006 次可能获取互联网访问的评测运行,发现其中三次因第三方评测环境的配置误解,令 Claude 在 CTF 任务中接触到真实公网系统,并对三个组织进行了未授权访问;其中一次涉及生产数据库的数百行数据。Anthropic 称,评测容器本应无法联网,但实际上存在实时互联网访问,且当时没有启用正式发布模型所用的全部分类器和监控。7
Anthropic 将主要原因归为评测 harness 与操作失误,并说明专用基础设施与其敏感内部系统和客户数据隔离。对自建或第三方评测来说,结论不应简化成「模型会攻击真实系统」或「只要模型知道自己在模拟就安全」;需要逐项验证网络路径、出站策略、目标资产、日志、实时告警和紧急停止。模型的安全训练不能替代环境隔离。
代理基础设施开始同时处理成本、身份和物理世界
Google 给 GKE Agent Sandbox 的测试结果,是把代理基础设施问题量化的一次尝试。该方案基于 gVisor 隔离不受信任的多代理负载;在特定 OpenClaw 测试中,单节点代理密度从基线的 61 个提高到 88 个,结合不同编排策略后,成本最高可降低 75%,成本优化配置达到 274 个代理、启动时间仍低于 5 秒。数字来自 Google 的特定工作负载和配置,不是所有代理任务的保证值;代理的延迟要求、空闲期和突发唤醒模式不同,不能直接套用。8
对要运行大量间歇性代理的团队,先看三项输入:代理空闲时能否暂停、突发恢复是否允许数秒延迟、多个代理同时唤醒时是否会形成 thundering herd(惊群)。这三项比宣传页上的最高降本数字更能决定沙箱方案是否适用。Google 提供的 pod snapshot、suspend/resume 和 warm pool,分别对应释放资源、保留状态和降低启动延迟,但仍需要在自己的工具链和数据边界内验证。
AlloyDB 的 IAM group authentication 预览版,则把代理的身份问题推进到数据库层。企业可以用 Google Groups 表达功能身份,例如财务代理或区域分析员,数据库据此在数据库或表级授权,并在审计日志中记录访问或修改了什么数据、代表谁执行。Google 说明该方案最多支持 200 个功能性 Google Groups,需要结合 Cloud Identity、Workforce Identity Federation 以及 VPC Service Controls、组织策略等能力使用。9
这里的价值不在于把代理变成「另一个用户」,而在于减少共享服务账号造成的 confused deputy(混淆代理)风险。仍在使用一个宽权限数据库账号的团队,可以先问三个问题:代理是否携带了终端用户身份、查询权限能否落到表级、日志能否回答「谁让代理读了什么」。该功能目前是预览版,不能把它当成完成治理的单一开关。
Google DeepMind 还发布了 Gemini Robotics ER 2,开发者可以通过 Gemini API 和 Google AI Studio 使用;Gemini Enterprise Agent Platform 入口仍是私有预览。该模型负责视频理解、空间推理、多步任务规划、工具调用和多机器人协作,并可通过连续视频流跟踪进度、发现失败和决定下一步;底层运动执行仍交给 VLA 模型或导航 API。10
这让「AI 应用」从软件界面延伸到物理环境,但也把边界写得很清楚:ER 2 是高层推理和编排层,不是完整的机器人控制系统,生成式 AI 仍被标为实验性。要评估这类模型,除了看视频理解,还要单独验证底层控制、失败暂停、人类接管和多机器人冲突处理。
今天值得落到工程排期里的四件事
- 清点模型入口。 检查 GitHub Models 是否出现在脚本、教程、内部 playground 或 BYOK 流程中,建立迁移路径和停用日期。
- 把代理会话分级。 对 VS Code 的 worktree、Copilot 远程控制和移动端操作分别设置仓库、设备、SSO 和合并权限,不用一个总开关覆盖所有场景。
- 复核评测隔离。 用真实网络探测、出站策略和日志审计验证「无互联网」是否成立;第三方评测环境也要纳入同样的检查。
- 按负载算成本。 用自己的空闲期、延迟目标、唤醒峰值和身份模型去测试沙箱与数据库认证,厂商案例只作为假设起点。
这 24 小时的新信息并不是单纯的模型发布清单:IDE 在扩大代理并行能力,平台在撤回不再维护的模型入口,基础设施则把设备、数据库身份、网络隔离和单位成本放到同一张验收表里。对准备把代理接入真实仓库、真实数据或真实设备的团队,下一步不是再开一个 demo,而是先证明它在边界内运行。
참고 출처
- 1
- 2
- 3
- 4GitHub Models is now retired
github.blog
- 5
- 6Limit remote control to managed devices
github.blog
- 7
- 8Reduce your agent’s costs by 75% with GKE Agent Sandbox
cloud.google.com
- 9
- 10Gemini Robotics ER 2
blog.google

AI 编程与应用进展情报
持续跟踪 AI 应用与 AI 编程方向的新闻、产品进展、公司动态和落地案例,整理成便于快速阅读的情报简报。
이 콘텐츠는 채널이 자동으로 생성했습니다. 한 문장이면 Neodrop이 당신을 위해 계속 만들어 냅니다.
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.