AI工具创业速报:Agent进入受控生产,平台退场与4.1亿美元算力合同并行

AI工具创业速报:Agent进入受控生产,平台退场与4.1亿美元算力合同并行

Google、微软、GitHub、ChipAgents 与 AWS 的本周动作显示,Agent 创业竞争正在从模型调用转向运行护栏、安全动作、平台连续性、垂直验证和算力成本。

先看结论

本周最值得创业者关注的变化,不是某个模型又多了一个榜单成绩,而是 Agent 产品的运营条件开始写进产品本身:Google 给 Managed Agents 加上工具调用钩子、预算上限和定时触发;微软把安全 Agent 分成红队、蓝队和绿队;GitHub 直接撤掉 Models 服务;ChipAgents 用融资推进芯片设计 Agent;Recursive 则与 AWS 签下 4.1 亿美元多年算力合作。1 2 3
这五条消息分别落在运行控制、安全闭环、平台依赖、垂直工程和算力成本上。它们共同指向一个更具体的创业问题:当模型可以自主执行任务后,谁负责拦截错误动作、维持平台连续性、验证领域结果,以及支付每一轮自动化的成本?
覆盖窗口为 2026 年 7 月 24 日 17:15 至 7 月 31 日 17:15(北京时间)。表中的产品状态、限制和商业条款与编辑判断分开写;公司自报的测试成绩和客户案例,不外推为行业平均表现。

快速总览

事件已确认变化可用范围与限制创业者要看什么
Google Managed Agents默认切到 Gemini 3.6 Flash;增加环境 hooks、预算控制、定时触发和环境管理 API。1支持免费层项目;Agent 仍以 antigravity-preview-05-2026 等预览能力为核心,免费额度未在公告中披露。Agent 产品的差异化开始包含拦截、恢复和成本上限,而不只是模型选择。
Microsoft Project Perception用红队、蓝队、绿队 Agent 组成持续发现、判断和修复的安全系统。2计划于 8 月 3 日进入 public preview;首个场景是软件漏洞管理,当前不能当作正式可用产品。安全工具要把告警连接到动作、审批和复盘,不能只增加检测数量。
GitHub Models 退役Playground、模型目录、推理 API 和 BYOK 对所有客户停止提供,包括仍在使用的客户。3退役已于 7 月 30 日生效;GitHub 只建议转向 Microsoft Foundry 或 Copilot,未提供迁移工具和价格对照。模型接入层不能把单一平台当作永久基础设施,迁移测试应成为产品资产。
ChipAgents 融资与 NVIDIA 合作ChipAgents 追加 6000 万美元 Series A 融资,并扩大与 NVIDIA 的合作,开发面向芯片设计的专用 AI 模型。4Reuters 报道该轮使 Series A 累计融资达到 1.31 亿美元;NVIDIA 是否为投资方未披露。垂直 Agent 的价值在可验证的工程结果,尤其是验证、测试和缺陷发现。
Recursive 与 AWS 算力合作签署 4.1 亿美元多年云合作,用 AWS 承载自动化 AI 研究系统,并计划共同开发配套基础设施。5这是云计算合作金额,不是已披露的股权融资;公司需要承担长期算力承诺。6对高频 Agent 或研究循环,算力合同会反过来决定产品节奏、毛利和现金消耗。

1. Google Managed Agents:把 Agent 变成可拦截、可暂停的运行时

Google DeepMind 7 月 28 日更新 Gemini API Managed Agents,默认模型切换为 Gemini 3.6 Flash,同时保留 Gemini 3.5 Flash 和更低成本的 3.5 Flash-Lite 供开发者选择。一次 API 调用可以在隔离的云沙箱中协调推理、代码执行、安装依赖、文件管理和网页检索。1
变化最大的部分是 environment hooks。开发者可以在每次工具调用前后运行自己的命令或 HTTP 处理器,用正则匹配特定工具;在调用前返回 deny,就能阻止 Agent 执行。Google 给出的例子包括在 code_executionwrite_file 前做安全门禁,在工具调用完成后运行自动格式化。1
它还增加了三类容易被低估的运行控制:
  • max_total_tokens 可以限制一次任务的输入、输出和思考总量;达到上限后,交互返回 incomplete,环境状态保留,开发者可以用新的预算继续执行。
  • scheduled triggers 可以把 Agent、环境、提示词和 cron 计划绑定成持久资源,每次运行复用同一个沙箱。
  • Environments API 可以从代码里查看和删除沙箱,任务断线后也能找回环境 ID;官方说明沙箱有 7 天 TTL。
Managed Agents 现在也可以在没有启用计费的项目中使用免费层,但 Google 没有在这篇公告中给出免费额度。对创业团队来说,这组更新的价值不在于「又一个 Agent API」,而在于它把 工具调用前的策略、任务中途的预算和任务结束后的环境回收 放进了同一层。
如果你在做 Agent 平台,本周可以把一个真实任务接入三道控制:危险工具调用先拒绝,任务预算耗尽后可恢复,重复任务使用持久环境但能主动回收。没有这三个指标,Agent 的成功率再高,也很难解释单次任务为什么变贵、为什么失控、为什么无法复现。

2. Project Perception:安全 Agent 开始负责动作,不只负责告警

微软在 7 月 27 日发布的文章中介绍 Project Perception,一套面向 AI 时代的 Agentic Security 系统,计划于 8 月 3 日进入 public preview。它把 Agent 分成三类:红队 Agent 主动寻找入侵路径,蓝队 Agent 调查信号并判断风险,绿队 Agent 执行修复和强化动作。2
系统由信号、上下文、模型、编排框架、Agent 和执行器组成。微软强调它采用多模型架构,按任务的质量、可靠性、延迟和成本选择模型;首个场景是软件漏洞管理,MDASH 与 MAI-Cyber-1-Flash 的组合由微软称在 CyberGym 上达到 96%,并比当前配置节省接近 50% 的成本。这些数字来自微软自己的评估和配置,不能直接当作其他安全团队的预期结果。2
Project Perception 的红队、蓝队和绿队 Agent 架构图
微软官方图示将三类 Agent 串成「发现入侵路径、判断风险、执行修复」的连续流程;Project Perception 计划于 2026 年 8 月 3 日开放 public preview。2
这条产品路线对创业者的提示很直接:安全 Agent 的付费点可能不是再生成一份风险报告,而是接入身份、终端、云和代码环境后,把发现结果送进可审批、可回滚的动作链。可是 Project Perception 目前还没有进入公开预览,微软披露的成本和准确率也仍属于特定配置下的自报数据。
做安全产品的团队可以先画一张「发现到修复」的权限图:哪些动作只读,哪些动作必须审批,哪些修复可以自动执行,怎样保留原始证据。对于其他企业 Agent,这张图同样适用。Agent 是否能进入核心流程,往往取决于动作边界是否可审计,而不是聊天界面是否更流畅。

3. GitHub Models 退役:平台依赖的成本被一次性暴露

GitHub 的 changelog 写明,GitHub Models 已于 7 月 30 日退役。受影响的不只是 Playground,模型目录、推理 API 和 BYOK 也同时停止,现有客户即使仍在使用也不能继续访问。GitHub 建议需要模型访问的新旧项目转向 Microsoft Foundry;要在 GitHub 内直接构建 AI 工作流,则使用 Copilot。3
这不是一次价格调整,而是一个平台入口的消失。GitHub 没有在退役公告里给出自动迁移工具、兼容层或价格对照表,开发者能做的主要是重新选择模型接入方式。
对独立开发者和早期团队,最实际的动作是做一次依赖盘点:模型 ID、推理端点、API key 管理、提示词测试、速率限制和输出格式都要有可替代路径。把这些东西散落在业务代码里的项目,迁移成本会高于切换一个 SDK;把模型层封装成接口,并保留一组回归样例,才有机会在平台策略变化时保持产品连续性。
这条消息也提醒做开发者平台的创业者:免费或低门槛的模型入口可以带来早期用户,但它本身不等于稳定的商业承诺。产品若依赖平台补贴,就要把退出条件和迁移路径写进自己的交付设计。

4. ChipAgents:融资投向可验证的芯片设计环节

Reuters 7 月 29 日报道,芯片设计初创公司 ChipAgents 追加 6000 万美元 Series A 融资,使该轮累计融资达到 1.31 亿美元。公司软件用 AI Agent 加速半导体设计,CEO William Wang 告诉 Reuters,当前最明显的提速场景是验证芯片是否按预期工作;公司还在本周扩大与 NVIDIA 的战略合作,共同开发面向芯片设计的专用 AI 模型。NVIDIA 是否参与投资,ChipAgents 没有披露。4
芯片设计传统上需要多年时间和数亿美元成本,验证阶段又有明确的错误信号和测试结果。这样的场景适合 Agent:它可以提出修改、运行工具、检查结果,再把失败原因带回下一轮,而不是只生成一段工程师还要手工验收的代码。这里的判断是编辑推断,不是 ChipAgents 已经达到某种交付规模的证据。
创业者可以从自己的行业里寻找同样的结构:任务是否有清晰的输入和输出,结果能否通过测试、仿真或规则复核,失败后是否能自动重试。如果三项都成立,垂直 Agent 比通用聊天入口更容易形成采购理由;如果结果只能靠专家凭感觉判断,Agent 的自动化承诺会很快变成昂贵的人工复核。

5. Recursive 与 AWS:4.1 亿美元算力合作把成本写进路线图

AWS 7 月 28 日宣布,Recursive 与 AWS 签署 4.1 亿美元多年合作协议,由 AWS 承载 Recursive 的自动化 AI 研究系统,双方还计划共同开发面向大规模自动化 AI 研究的基础设施。Recursive 把这套系统描述为能够提出想法、运行实验、验证结果并选择下一轮实验的自动化研究流程。5
TechCrunch 报道称,这笔交易是算力支出而不是 AWS 的股权投资;报道还引述 Recursive CEO 表示,这可能只是未来多笔算力合同中较小的一笔。AWS 官方公告本身没有把合作写成股权融资,因此不能把 4.1 亿美元当作 Recursive 新一轮融资。6
这条消息对普通 AI 应用团队的意义,不是建议复制同样规模的合同,而是提醒大家把推理和实验成本当作产品约束。高频 Agent 的成本通常由循环次数、工具调用、上下文长度、并行任务和失败重试共同决定;只看单次 token 价格,会漏掉真正的现金消耗。
本周可以把一个高频工作流拆成四个数:每次任务的模型与工具成本、平均循环次数、失败重试比例、一次任务的可接受上限。只有知道这四个数,才有资格比较自建、云托管和专用算力。大额算力合同说明供应商愿意为特定工作负载共建基础设施,但它不能替代你自己的真实负载测试。

给创业团队的本周动作

  1. 做 Agent 平台或自动化产品:为每个工具调用定义允许、拒绝和人工审批三种结果,并记录预算耗尽后的恢复行为。
  2. 做安全或企业软件:把「检测、判断、修复、回滚」拆成独立权限,先在一个低风险流程验证误报率和人工复核时间。
  3. 做垂直开发工具:选择能通过测试、仿真或规则验收的环节,建立 Agent 输出到工程结果之间的可追踪链路。
  4. 依赖单一模型或平台的团队:列出端点、模型 ID、密钥、提示词和回归样例,至少准备一个可替换的模型接入路径。
  5. 模型调用量快速增长的团队:按真实任务计算循环、重试和工具成本,再决定是否需要预留算力或更换运行架构。
五条消息放在一起,结论比「模型越来越强」更具体:Agent 的竞争正在同时经过运行时护栏、安全动作、平台连续性、领域验证和算力账单。创业团队现在能做的,不是猜哪家模型会永久领先,而是把这些边界变成自己产品里可测量、可迁移、可审批的部分。

Related content

  • Sign in to comment.
More from this channel