
AI 编程情报:评测噪声、安全扫描与代理治理
本期梳理 7 月上旬 AI 编程与应用进展:OpenAI 对 SWE-Bench Pro 的审计削弱了单一榜单信号,GitHub 把提示注入检测、Copilot 遥测、MDM 管控和移动端代理会话补齐,Moderne 与 Google 的案例分别指向代码评审瓶颈和边缘 AI 应用落地。
7 月 8 日到 10 日的更新没有再把重点放在新模型参数上,而是集中暴露了 AI 编程进入生产后的三类硬问题:评测数据能不能信,代理写出的代码能不能审,企业能不能看见并管住代理的行为。OpenAI 撤回了对 SWE-Bench Pro 的推荐,GitHub 把提示注入检测、OpenTelemetry、MDM 管控和移动端代理会话继续补齐,Google 的赛道教练案例则把边缘 AI、云端推理和实时验证放进同一个应用栈。123
| 信号 | 发生了什么 | 影响对象 | 下一步看点 |
|---|---|---|---|
| OpenAI 审计 SWE-Bench Pro | OpenAI 审计 731 个公开 split 任务后估计约 30% 任务存在破坏性问题,并撤回此前建议采用 SWE-Bench Pro 的表态。1 | 评估编码模型、采购 coding agent 的团队 | 不要只看单个 benchmark 排名,要看任务质量、污染风险和失败样本。 |
| CodeQL 开始覆盖系统提示注入 | GitHub 发布 CodeQL 2.26.0,新增 js/system-prompt-injection 查询,检测不可信用户输入流入 AI 模型系统提示的路径。2 | 做 AI 应用安全、代码扫描和供应链治理的团队 | 把 prompt injection 从安全评审文档推进到静态分析规则。 |
| Copilot 的企业可观测性继续补齐 | GitHub 允许企业强制 Copilot Chat 与 Copilot CLI agent host 把 OpenTelemetry 数据送到指定 collector,并控制 prompt、response、tool content 是否采集。4 | 大规模部署 Copilot 的平台与安全团队 | 代理行为日志会成为权限、成本和审计的基础设施。 |
| VS Code 代理工作台继续变厚 | GitHub 汇总 VS Code 1.123 到 1.127 的 Copilot 更新:agentic browser tools 默认开启,支持并行 agent sessions、会话成本可见、Marketplace 模型发现和 Autopilot 改进。5 | VS Code 用户、插件生态、企业开发体验团队 | IDE 正在从「聊天侧栏」变成管理多个代理任务的工作台。 |
| GitHub Mobile 接住远程代理队列 | GitHub Mobile 支持 Copilot CLI 远程会话的实时通知、移动端修复 PR merge conflicts,以及按状态、仓库、类型、agent 筛选 Copilot sessions。678 | 需要离开电脑但仍要盯 agent 进度的开发者 | 移动端不只是提醒入口,开始接管「等输入、看日志、解冲突」这些长任务节点。 |
| Morgan Stanley 的代码评审瓶颈案例 | Moderne 复盘 Morgan Stanley 的内部实践:AI 和大规模重构让代码变化更快,瓶颈转移到 PR review;其方案是按风险路由 PR,并让确定性工具执行大规模变更。9 | 平台工程、代码现代化、安全修复团队 | AI 写代码只是前半段,合并前的风险分层和可审计执行会更稀缺。 |
| Google 用赛车教练展示边缘 AI 应用栈 | Google Developers Blog 展示 AI Race Coach:Antigravity 做实时编排,ADK 管理 agents,Gemma 4 在本地做低延迟音频提醒,Gemini API 做云端赛后建模。3 | 做实时 AI 应用、边缘设备和行业 agent 的团队 | 高风险场景会同时要求本地推理、云端分析、物理数据校验和人可理解的反馈。 |
评测:SWE-Bench Pro 的信号被 OpenAI 打了折
OpenAI 这次不是发布新模型,而是审计一个编码评测集。SWE-Bench Pro 原本用于测试更长周期、更接近真实工程的 agentic coding 任务。OpenAI 写道,在 731 个任务的公开 split 上,前沿模型通过率 8 个月内从 23.3% 提升到 80.3%。如果任务本身干净,这会是很强的能力提升信号。1
问题在任务质量。OpenAI 的 datapoint analysis pipeline 标记出 200 个破坏性任务,占 27.4%;人工标注活动识别出 249 个,占 34.1%。OpenAI 最后估计约 30% 的 SWE-Bench Pro 任务存在破坏性问题,并撤回此前建议社区采用 SWE-Bench Pro 的说法。1
这些问题主要落在四类:测试过度严格、prompt 信息不足、测试覆盖过低、prompt 误导模型。换成日常工程语言,就是任务说明、隐藏测试和参考实现没有对齐。模型可能按题面写出了合理答案,却因为隐藏测试要求了题面没说的细节而失败;也可能只补了一部分功能,却因为测试太弱而通过。1
对读者的影响很直接:coding agent 采购、模型选型和安全放行不能只盯「某榜单第一」。如果一个评测集三成任务有问题,榜单上的差距就可能被任务噪声放大。更稳的做法是保留自己的任务集,看失败样本,并把评测当成一组证据,而不是最终裁决。
安全:CodeQL 把 prompt injection 放进静态分析
GitHub 的 CodeQL 2.26.0 更新把 AI 应用安全拉进常规代码扫描。它新增了 JavaScript/TypeScript 查询
js/system-prompt-injection,用于检测不可信、用户提供的值流入 AI 模型系统提示的路径。GitHub 对风险的描述很直白:攻击者可以借此操纵模型行为。2同一版本还补了更多 prompt injection sinks,覆盖 OpenAI、Anthropic 和 Google GenAI SDK 的更多 API,包括 Sora prompts、OpenAI Realtime session instructions、Anthropic legacy completion prompts,以及 Google GenAI cached content 和 system instructions。2
这条更新的意义不在于 CodeQL 能一次解决 prompt injection。它说明 AI 应用安全正在被归入普通软件安全流程:代码扫描、查询规则、误报修正、版本升级。CodeQL 2.26.0 已自动部署到 github.com 的 GitHub code scanning 用户,未来也会进入 GitHub Enterprise Server;旧版 GHES 用户可以手动升级 CodeQL。2
如果团队正在把 LLM 接进客服、代码生成、自动化运维或内部知识库,下一步应该检查两件事:用户输入有没有进入 system prompt 或高权限 instruction,SDK 调用有没有被现有 SAST 规则覆盖。过去这类问题常靠人工 threat modeling;现在至少可以先进入自动扫描队列。
治理:Copilot 从 IDE 功能变成可观测服务
GitHub 7 月 8 日的两条治理更新值得和上一期的预算 API 放在一起看。企业现在可以强制 Copilot 的 OpenTelemetry 数据流向批准的 collector,不要求每个开发者自己配置
OTEL_* 环境变量。管理员可以控制 OTLP endpoint、transport protocol、service name、resource attributes、exporter headers,也能决定 prompt、response 和 tool content 是否采集,以及开发者能不能改。4它还处理了一个很实际的泄露风险:managed exporter headers 只会应用到 Copilot Chat extension 的 OTLP exporter,不会通过环境变量传给 agent host 启动的工具子进程。换句话说,collector 的认证 token 不应该被下游工具顺手拿到。4
另一条更新是 MDM 和文件级托管设置。企业可以通过 Windows Registry、macOS managed preferences、
managed-settings.json 或服务器托管通道下发 Copilot 配置,覆盖 VS Code 和 Copilot CLI。优先级是 Native MDM 高于 server-managed,高于 file-based。支持的键包括 permissions.disableBypassPermissionsMode、model、enabledPlugins、strictKnownMarketplaces 和 telemetry.*。10这组能力的方向很明确:Copilot 不再只是编辑器插件,而是企业端点上的受管服务。模型选择、插件市场、权限绕过、遥测采集和工具内容是否入日志,都要进入设备管理和平台治理。对大团队来说,先把这些开关列出来,比先争哪个模型更强更实际。
工作台:VS Code 和 GitHub Mobile 继续接长任务
VS Code 的 6 月到 7 月初 Copilot 汇总,重点是把 agent 任务管理做厚。GitHub 写明,这批更新覆盖 VS Code v1.123 到 v1.127,包括 agentic browser tools 默认可用、浏览器支持搜索和截图、远程 workspace 的 HTTP(S) 流量可通过 remote connection 代理,以及把页面截图或局部截图交给 agent。5
代理会话也更像一个任务面板。Agents window 支持多个 session 并排运行,同一个 session 里可以开多个 chat,把实现、评审、测试和文档拆成不同工作流。成本侧也更细,开发者能看整段会话 credit 使用、额外 Copilot spend,以及 subagent 被委派工作时的用量。5
移动端补的是长任务的「不在电脑前」场景。GitHub Mobile 现在能给远程 Copilot CLI sessions 发实时通知,显示 in progress、waiting for user input、idle 和 finished 等状态;点击通知可以回到 mobile 的 session logs。6
同一批移动端更新还允许在 PR merge box 里点「Fix with Copilot」,预填一条让 Copilot 解决冲突的评论并启动 Copilot cloud agent。会话多了以后,GitHub Mobile 也补了按 active、status、repository、type、agent 过滤,以及按最近、最旧、active first、needs-attention first 排序。78
这不是移动端也能写代码,而是代理任务的生命周期变长了。开发者需要在会议间隙确认输入、看失败日志、把冲突处理交给 cloud agent,或者判断哪个 session 需要人工接手。AI 编程工具如果只优化「发出第一条 prompt」,很快会卡在这些收尾动作上。
代码评审:Morgan Stanley 案例把瓶颈指向合并前
Moderne 的文章带有供应商案例属性,但里面对代码评审瓶颈的描述值得纳入观察。Dov Katz 和 Khalid Elsawaf 复盘 Morgan Stanley 使用 OpenRewrite 和 Moderne 的经验:大规模重构和 AI coding 让改代码更容易,新的约束转到 review。文中称 Morgan Stanley 已有数千名开发者 onboard,内部社区贡献的 recipe marketplace 增长到数百个 recipe。9
Khalid Elsawaf 的核心判断是,代码评审没有像 QA 和安全那样左移,反而更依赖最资深工程师。AI 让 PR 数量和体量上升,reviewer 却仍是稀缺资源。文章把解决方向放在 risk-based PR routing:低风险变更走快通道,高风险变更进入更深评审。Morgan Stanley 过去在变更审批里用过 Data-Driven Risk Assessment,把系统画像、变更历史和事故数据用于风险评分,现在把类似思路推到 PR review。9
更具体的工程模式是「AI 规划,确定性工具执行」。文章举了 AssertJ 升级案例:agent 研究 changelog、识别 deprecated method patterns,并生成一个只搜索不改代码的 OpenRewrite recipe,先跑出影响文件清单。另一个 Java build cache rollout 案例里,AI 跨数百个仓库编排周末迁移,平台执行变更,agent 监控 PR build、分析 CI 日志,并把与本次变更无关的失败标为 draft。9
这里的边界也要说清楚:这是厂商博客中的客户实践,不等同于独立第三方评测。但它给平台团队提供了一个检查问题的角度。AI 代码生成提速以后,真正稀缺的可能是风险分层、自动验证、可审计证据和合并路径,而不是再多一个写代码入口。
应用落地:Google 把「可信 AI」放到赛车边缘场景里测
Google Developers Blog 的 AI Race Coach 是一条应用落地案例。5 月 23 日,Google Developer Experts 在 Sonoma Raceway 用 Antigravity 和 Gemini 搭了一个实时 AI 赛车教练。Google 称系统在 2 号弯中段识别出新的油门应用区域,带来 0.1 秒优势。这个数字很小,但在赛车语境里有明确的物理反馈。3
技术栈比案例叙事更有用。Antigravity 负责实时代码迭代和领域知识连接,Python 做车端遥测摄取和解析,ADK 管理多个 agent,Jetpack Compose 做高刷新 Android cockpit dashboard,Gemini API 做赛后驾驶员建模和云端推理,Gemma 4 本地运行,作为低延迟、离线音频提醒层。3
它的架构流也比较清楚:Pixel 10 上的 Python 脚本从车辆采集实时 telemetry,Android app 做空间指标和弯道阶段展示,Gemma 4 处理本地流并在断网时做实时提醒,云端 Gemini API 对照驾驶员模型评估表现,最后通过 TTS 和 dashboard 给出反馈。Google 还写到,社区成员 Brian Luc 做了自定义 USB interface,让 Pixel 10 直接接入车辆 telemetry network,以 10 Hz 数据流读取传感器输入;启用 Pixel 10 TPU 后,本地性能达到每秒 40 tokens。3
这个案例不该被读成「赛车应用多有趣」。它更像一个实时 AI 应用模板:物理世界数据先落到边缘设备,本地模型处理低延迟提醒,云端模型做复杂分析,agent 框架管理多步骤流程,最后通过声音和仪表盘把建议还给人。真正难的是验证建议是否安全、是否及时、是否能被现场人员理解。
对读者的直接判断
- 如果你在评估 coding agent,今天最该补的是内部评测集。外部榜单可以参考,但要把任务质量、污染和隐藏测试问题纳入采购判断。
- 如果你在做 AI 应用安全,把 prompt injection 当成数据流问题处理。系统提示、工具调用、SDK sink 和用户输入路径都应该进代码扫描和 review 清单。
- 如果你负责企业 Copilot 部署,OpenTelemetry、MDM、managed settings 和预算 API 应该一起看。先决定记录什么、谁能改、哪些工具内容不能出日志,再谈大规模开放。
- 如果你带平台工程团队,别只优化「让 agent 生成更多代码」。PR 风险分层、自动验证和合并前证据,可能比生成速度更快成为瓶颈。
- 如果你在做行业 AI 应用,Google 的赛车教练案例提供了一个有参考价值的边缘架构:低延迟的本地推理、云端复杂分析、物理数据校验和人类可接收的反馈,需要一起设计。
참고 출처
- 1Separating signal from noise in coding evaluations
- 2CodeQL 2.26.0 adds Kotlin 2.4.0 support and AI prompt injection detection - GitHub Changelog
- 3Bridging the Domain Gap: AI Race Coach built with Antigravity and Gemini - Google Developers Blog
- 4Enterprise-managed OpenTelemetry export for VS Code and CLI - GitHub Changelog
- 5GitHub Copilot in Visual Studio Code, June 2026 releases - GitHub Changelog
- 6GitHub Mobile: Live notifications for Copilot CLI sessions - GitHub Changelog
- 7GitHub Mobile: Fix merge conflicts with Copilot cloud agent - GitHub Changelog
- 8GitHub Mobile: Improved filters and sorting for Copilot sessions - GitHub Changelog
- 9AI Code Review Is the New Bottleneck in Agentic Coding - Moderne
- 10Deploy managed Copilot settings via MDM in VS Code and CLI - GitHub Changelog
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
