AI 编程与应用情报:移动端修 PR、提示词进入构建系统,代理开始调用真实服务

AI 编程与应用情报:移动端修 PR、提示词进入构建系统,代理开始调用真实服务

GitHub、Google、Thinking Machines、DoorDash 与 Emergent 的近期更新显示,AI 代理正进入代码评审、构建系统和真实业务服务,但验证、权限与人工接管仍是落地前提。

GitHub 在手机端新增了从 Copilot 代码审查评论直接发起修复的入口,Google 把代理平台、提示词构建和 token 使用整理成一套工程材料,Thinking Machines 开放了可微调的 Inkling,DoorDash 则把下单能力放进了面向 AI 代理的命令行工具。过去几天的更新,落点已经从「模型能不能写代码」移到「代理能否进入评审、构建和真实业务流程」。
时间范围:2026 年 7 月 15 日至 18 日(北京时间)。

快速浏览

进展发生了什么主要影响对象
GitHub MobilePull Request 的 Copilot 审查评论可直接点「Fix with Copilot」,最新 iOS 和 Android 生产版均可用。1需要在移动端跟进代码审查的开发团队
Google Cloud Agent Platform发布 13 个动手示例,覆盖 ADK、MCP、A2UI、长任务、人工审批、网关治理和代理评测。2构建企业代理的工程师和平台团队
代理工程方法Google 文章建议把模块化 prompt 当作构建产物,做导入、变量、循环依赖和 golden file 校验;另一篇指南把技能文件、CLI、子代理和提前测试纳入 token 使用管理。34正在把代理从 demo 推向生产的团队
Thinking Machines Inkling发布 975B 总参数、41B 激活参数的多模态 MoE 开放权重模型,支持最长 100 万 token 上下文,并可在 Tinker 上微调。5需要自定义模型或控制推理成本的开发者
DoorDash dd-cli面向美国和加拿大 macOS 开发者开放有限 beta 等候名单,AI 代理可用它搜索商家、找优惠并结账。6做代理工具、消费应用和电商集成的团队
Emergent 融资AI 编程初创公司完成 1.3 亿美元 C 轮融资,投后估值 15 亿美元;公司称年化收入达到 1.2 亿美元、付费客户超过 20 万。7关注 AI 编程产品商业化和 SMB 应用的读者

GitHub:手机端可以直接修复 Copilot 审查评论

GitHub Mobile 现在可以在 Pull Request 主视图或单条 Copilot 代码审查评论中点击「Fix with Copilot」,由 Copilot cloud agent 根据评论启动修复,不需要开发者先手写 prompt。该功能已进入最新生产版 GitHub Mobile,覆盖 iOS 和 Android。1
这不是把代码审查变成自动合并。它只是把「看到评论」到「让代理准备一个修复」之间的入口缩短了,人工仍要看 diff、跑验证并决定是否合并。GitHub 工程团队 7 月 18 日的另一篇文章也给出了一条更实用的判断标准:AI 生成的第一版 patch 可以用来估算改动边界,但代码真正便宜的前提是人能看懂、复核并长期负责;涉及权限、隐私、计费或合规的改动,即使生成代码很快,也不应因此降低审查标准。8
对团队来说,移动入口的价值取决于审查链是否已经清楚定义了测试、风险标记和人工接管点。单看「一键修复」不能推出交付速度提升,GitHub 的更新也没有提供这类效率数据。

Google Cloud:代理平台的示例开始覆盖完整生命周期

Google Cloud 在 7 月 17 日发布了 13 个 Gemini Enterprise Agent Platform 动手示例。内容从 ADK 的第一个代理开始,延伸到 MCP 工具、动态 Agent-to-UI、带 Memory Bank 的有状态代理、可暂停和恢复的长任务、人工审批、Agent Gateway、mTLS、IAM、Model Armor,以及从代码代理直接运行的评测流程。2
其中一个费用审批示例把超过阈值的请求送入人工审核,并在前面加入 PII 脱敏、提示注入防护和合规分析;另一个示例用 Agents CLI 生成部署配置,再接入 Cloud Trace、Cloud Logging 和 BigQuery Agent Analytics。Google 还称,Agents CLI 可以装进 Antigravity、Claude Code 或 Codex,为代码代理提供七项 ADK 和 Agent Platform 技能。这里的重点是示例覆盖面,不应把 codelab 直接当成所有账户都已开放的产品能力。
工程团队可以先按「数据接入、暂停恢复、权限治理、评测」四个问题筛选示例,而不是从 13 个链接逐个照抄。长任务是否能恢复、工具调用是否能审计,通常比 demo 能否跑通更接近生产门槛。

Google:提示词和 token 消耗都被当成工程问题

Google Developers Blog 的一篇 7 月 16 日文章把生产代理的 system prompt 比作需要编译的代码。它建议把安全规则、领域规则和升级行为拆成模块化 skill 文件,通过模板导入、变量和宏生成确定的 prompt artifact,并在构建阶段检查缺失导入、未定义变量和循环依赖。CI 还可以重新生成 golden file,发现源码与已提交的产物不一致就失败。3
文章还提出渐进式加载:稳定的身份和安全边界留在基础 prompt,任务所需的技能在运行时按需取用。代理可以起草技能文件或导入关系的 Pull Request,但仍由人检查、运行评测并合并。这个边界很重要,代理是在提议修改自己的指令层,不是在运行时无审批地改写控制面。
Google Cloud 7 月 17 日发布的另一篇开发者指南则把 token 使用拆成 11 条实践,包括从合适的模型开始、复用 SKILL.md、用脚本和 CLI 处理重复任务、把输出密集型工作交给子代理、尽早测试、偏离时撤销以及为新主题开启新会话。它是方法指南,不是独立的性能基准;能否节省成本仍要结合团队自己的任务、模型和上下文长度测量。4

Thinking Machines:Inkling 把开放权重和可定制放在首位

Thinking Machines Lab 7 月 15 日发布 Inkling,称其为从头训练的开放权重模型。官方披露的规格是 975B 总参数、41B 激活参数、最长 100 万 token 上下文,预训练数据包含文本、图像、音频和视频,共 45 万亿 token;模型支持可控的 thinking effort,并可在 Tinker 上直接微调。官方同时发布了 12B 激活参数的 Inkling-Small 预览版。5
这条消息对 AI 编程的直接价值不只在模型大小,而在于开发者可以把它作为一个可定制的基础模型,接入 OpenCode 等 agent harness,再用 Tinker 做后训练。Thinking Machines 自己也明确写道,Inkling 并不是当前整体最强的模型,开放权重、多模态、可控推理和可微调性才是它的定位。页面中的 benchmark、成本曲线和案例属于厂商自测,不能直接替代独立评测。
如果团队正在比较闭源 API 和开放权重方案,应该把微调入口、实际推理成本、工具调用稳定性和部署约束放在同一张测试表里,不能只比较参数量或上下文窗口。

DoorDash:代理开始调用真实消费服务

DoorDash 开放了 dd-cli 的有限 beta。根据 DoorDash 联合创始人兼 CTO Andy Fang 的公开说明,早期访问面向美国和加拿大的 macOS 开发者,并采用等候名单;命令行工具可以让开发者和 AI 代理搜索商家、寻找优惠、建立订单并结账。TechCrunch 还提到,DoorDash 要求申请者说明拿到权限后想构建什么。6
这比在聊天窗口里展示一个购物建议更接近「代理调用业务能力」:开发者可以把订餐、找本地优惠等能力组合进自己的工具或服务。但目前仍是受限 beta,来源没有证明它已面向普通用户开放,也没有披露足以评估规模化稳定性的订单数据。做类似集成时,支付确认、订单变更和失败恢复都应保留明确的人机交接点。

Emergent:AI 编程创业公司的商业化信号

TechCrunch 报道,印度 AI 编程初创公司 Emergent 完成 1.3 亿美元 C 轮融资,Creaegis 领投,投后估值 15 亿美元,总融资额达到 2.3 亿美元。该公司面向创业者和中小企业,试图把编程、部署、托管、测试和调试放在同一套产品里,客户案例包括货运、工厂、建筑和物业管理业务。7
Emergent CEO Mukund Jha 向 TechCrunch 透露,公司年化收入达到 1.2 亿美元,付费客户超过 20 万,过去四个月收入增长 70%。这些数字是公司向媒体提供的口径,不是经审计的行业统计。公司计划把新资金用于产品研发、提高应用构建成功率、改进核心代理工作流,并支持更多本地和开放模型。
对市场观察者来说,融资本身只能说明资本愿意继续押注「非技术用户用代理做软件」这条路线。更该跟踪的是应用交付后的留存、失败率、部署维护成本,以及客户是否真的把它当作长期业务系统,而不是一次性生成工具。

读者下一步看什么

  • 做代码代理的团队,可以先验证「评论到 patch」的链路:代理改了哪些文件、测试是否自动运行、哪些改动必须人工批准。
  • 做企业代理的平台团队,可以从 Google 的示例中优先检查长任务恢复、工具权限、提示注入防护和评测闭环,别把能跑通 codelab 当成生产就绪。
  • 评估模型和 AI 编程产品时,Inkling 的开放权重与 Emergent 的商业化分别代表供给侧和应用侧信号,但两者都需要用真实任务、成本和维护结果继续核对。

相似内容

  • 登录后可发表评论。
More from this channel