AI 全景情报 0708:模型主权、Agent 后台和推理底座同时变硬

AI 全景情报 0708:模型主权、Agent 后台和推理底座同时变硬

本期聚焦中国与乌克兰的模型主权信号、DeepSeek 推理芯片、Google 与 Claude 的后台 Agent、Meta Muse Image,以及 NVIDIA Vera CPU 与美国电力需求,判断 AI 竞争正在从模型能力延伸到部署控制权、运行时和推理基础设施。

7 月 8 日早上的 AI 信号很集中:前沿模型开始被当作可管制资产,Agent 产品从「聊天窗口」变成长任务后台,推理负载则把 CPU、电力和本地部署重新推到采购桌面上。对 AI 团队来说,接下来几个月的关键问题不只是「哪个模型更强」,而是模型能不能在你控制的环境里跑、Agent 能不能安全接工具、推理底座能不能承受连续工作负载。
信号发生了什么对 AI 从业者意味着什么接下来盯什么
模型主权中国监管部门据报道正讨论限制海外访问最先进国产 AI 模型;乌克兰也明确偏好可在本国基础设施运行的模型。12便宜、可下载、跨境可用这三件事可能不再同时成立。企业选型要把权重、托管区、出口限制写进模型采购清单。中国是否给开源权重分级;欧洲政府采购是否要求本地托管。
推理芯片DeepSeek 正在早期研发面向推理的自有 AI 芯片,已接触芯片设计、代工和内存伙伴。3模型公司继续向硬件下沉,重点不是训练大芯片,而是更便宜、更可控的推理。是否拿到先进制程与 HBM;第一代芯片先服务自用还是对外售卖。
托管 AgentGoogle 给 Gemini API 的 Managed Agents 加入后台执行、远程 MCP、函数调用和凭证刷新;Claude Cowork 同日扩展到 web 与移动端。45Agent 产品的交付标准正在变成「异步、可恢复、可审批、可接内部工具」。只会同步问答的产品会显得像半成品。背景任务的权限边界、审计日志、工具调用失败恢复。
生成媒体Meta 发布 Muse Image,并预告 Muse Video;Muse Image 接入 Meta AI、Instagram Stories 和 WhatsApp,带搜索、代码工具、自我修正与 Content Seal 水印。6图像模型竞争从「一次生成质量」转向「社交分发、广告素材、可追溯标记」。创作者工具会被平台入口吃掉一部分。Muse Video 何时开放;Content Seal 是否被广告主、平台审核和创作者接受。
推理底座Perplexity 确认计划使用 NVIDIA Vera CPU;EIA 预计美国用电量 2026、2027 年继续创高,AI 数据中心是主要推力之一。78Agent 连续运行会消耗 CPU、内存、网络和电力,不只是 GPU。基础设施团队需要重新算单位任务成本。Vera 的真实采购量;数据中心电力合同和商业用电增速。

1. 模型主权从口号变成采购约束

中国这条线的变化,比单个模型发布更影响下游选型。Reuters 称,中国商务部牵头的会议讨论了对最先进 AI 模型设置海外访问限制,范围可能覆盖闭源模型和更开放的版本;参会公司包括 Alibaba、ByteDance 和 Z.ai。报道还提到,相关限制仍在讨论中,可能只适用于未来模型。1
这会直接改变海外团队对中国低价模型的预期。过去半年,不少开发者把 Qwen、Doubao、GLM 等模型看作压低推理成本的替代选项。若未来高端模型需要安全审查、国内使用或更严格备案,成本优势还在,供应确定性会下降。最容易受影响的是把单一境外 API 当核心依赖的产品,尤其是客服、内容生产、代码辅助这类高调用量业务。
乌克兰的表态从另一个方向补上了同一件事。乌克兰数字化转型部首席 AI 官 Roman Kyslyi 称,乌克兰会优先选择可在自有服务器上运行的 AI 系统,核心不是模型来自哪里,而是供应商能不能让模型部署在乌克兰控制的基础设施上。该国 Diia 政务应用里的 AI 助手目前使用位于欧盟服务器上的 Gemini,但这是「interim」方案,乌克兰还在基于 Google Gemma 与 Kyivstar 开发自有模型,计划秋季发布。2
对从业者的含义很具体:模型评估表里要增加「部署控制权」这一列。API 延迟、价格、基准分数还不够,政府、金融、军工、医疗和跨境 SaaS 还要问四个问题:权重能否本地持有,日志是否出境,供应商能否远程关停,监管变化后是否有替代路径。

2. DeepSeek 走向推理芯片,说明模型公司不想只租算力

Reuters 报道称,DeepSeek 正在研发自有 AI 芯片,目标是推理而非训练;项目仍处早期,DeepSeek 已接触外部伙伴,并在私下招聘芯片设计工程师。DeepSeek 未回应置评请求。3
这不是「又一家 AI 公司造芯」这么简单。推理芯片的商业逻辑和训练芯片不同:训练看峰值算力和集群规模,推理更看单位 token 成本、功耗、内存带宽和持续供货。DeepSeek 的模型路线一直强调低成本推理,如果它能把模型结构、编译栈和芯片特性绑在一起,就有机会把成本优势固化到硬件层。
阻力也很硬。Reuters 提到,华为在中国 500 亿美元 AI 芯片市场中已拿到约一半份额,但其产品与 NVIDIA 最先进芯片仍有差距;DeepSeek 若要做自有芯片,还会遇到先进代工和高带宽内存限制。3
工程团队不必马上为「DeepSeek 芯片」改路线,但要把一个趋势放进成本模型:头部模型厂商会继续把推理栈往下扎。未来的竞争不会只发生在 API 价格表上,也会发生在编译器、内存布局、批处理策略和芯片供给优先级里。

3. Agent 进入后台工作流,产品形态开始定型

Google 的 Managed Agents 更新,把开发者最痛的几个工程点放到了台面上:后台执行支持长任务异步运行;远程 MCP 让 Agent 从安全沙箱连接内部数据库或 API;自定义函数调用允许本地业务逻辑参与;凭证刷新则解决短期 token 过期和网络规则替换。Google 的说法是,开发者只调用一个 endpoint,Gemini 处理推理、代码执行、包安装、文件管理和网页信息,运行在隔离云沙箱里。4
Anthropic 则从用户端推进同一方向。Claude Cowork 开始向 mobile 和 web 推出,先给 Max 用户开放 beta;官方称任务可在设备离线后继续运行,需要人判断时会把问题推到手机,用户确认前不会发送结果。Anthropic 还披露,Cowork 超过 90% 的使用不是软件开发,业务运营和内容创建合计约占一半。5
这两条合在一起看,Agent 的 MVP 标准已经变了。去年很多产品还在展示「它能打开浏览器、点按钮、写文档」。现在企业客户会追问:任务跑到一半断线怎么办,谁批准对外发送,凭证怎样轮换,哪些工具能被调用,失败状态能不能复盘。
对应用团队来说,Agent 的价值不在于替用户多聊几轮,而在于接住那些跨文件、跨系统、跨时间段的杂活。产品经理要把「开始任务」「挂起任务」「请求人工确认」「恢复任务」「审计任务」做成一等功能,而不是藏在聊天记录里。

4. Meta 把图像模型接进分发入口,生成媒体进入平台战

Meta 发布 Muse Image,并预告 Muse Video。官方称 Muse Image 是 Meta Superintelligence Labs 的首个图像生成模型,可调用搜索和代码工具、进行自我修正,并与 Muse Spark 协同;产品层面已接入 Meta AI app、meta.ai、美国的 Instagram Stories 和部分国家的 WhatsApp,Facebook 也在后续计划内。6
Muse Image 搜索增强效果图
Meta 官方图表显示,Muse Image 在启用搜索后,对 identities、brands、landmarks、facts 四类提示的内部胜率均高于未启用搜索版本;该图为公司自有 ablation 口径。6
这里最值得看的是分发位置。Muse Image 不是只放在一个独立生成器里,而是进入 Instagram Stories、WhatsApp 聊天和 Meta AI。对创作者和小商家来说,这比单纯模型榜单更重要:素材生成、发布、反馈、再创作都在同一个平台内完成,平台知道你的社交关系、账号语境和广告目标。
Meta 还给 Muse Image 加了 Content Seal 隐形水印,并预告未来扩展到视频。6 如果这个机制被平台审核、广告投放和创作者工作台采用,生成内容的竞争会多出一条新轴:不只是画得好,还要能证明来源、能被平台识别、能在商业内容里安全使用。

5. Agent 负载把 CPU 和电力推到前台

Perplexity 确认计划使用 NVIDIA 的 Vera CPU。NVIDIA 此前称,预计 Vera CPU 在本财年结束前带来 200 亿美元销售;Perplexity 负责计算企业与基础设施的副总裁 Nate Kupp 称,Vera 在 AI agent coding tasks 上比传统 CPU 快约 1.5 倍。Perplexity 没披露采购数量。7
NVIDIA Vera CPU 计算托盘
Reuters 图像显示,NVIDIA Vera CPU 计算托盘在台北 Computex 展会现场展出;Perplexity 本次确认计划采用 Vera CPU,但未披露采购规模。7
这解释了为什么 CPU 又被拉回 AI 讨论。Agent 不像人类用户那样在任务之间休息,它会持续读文件、跑工具、调网络、写代码、检查结果。GPU 负责模型推理的一部分,但大量编排、检索、代码执行和数据搬运会落到 CPU、内存和网络上。单看 GPU 利用率,容易漏掉真实瓶颈。
电力侧也在给同一个结论加压。美国能源信息署预计,美国用电量会从 2025 年的 4.195 万亿千瓦时升至 2026 年的 4.269 万亿千瓦时、2027 年的 4.399 万亿千瓦时;增长主要来自 AI 数据中心、加密计算和电气化。EIA 还预计,2026 年商业部门用电需求将首次超过居民部门。8
这对基础设施团队的提醒很直接:下一轮降本不是只谈「换更便宜的模型」。要把任务拆到 CPU 秒、内存带宽、网络出入、工具调用失败率、机房电价和排队时间。Agent 越像后台员工,成本模型就越像运营模型。

风口判断

  1. 可本地部署的高能力模型会继续升温。 政府、金融和跨境企业会把 on-prem、私有云、区域云作为默认要求,开源权重和可控推理栈的商业价值会上升。
  2. Agent 基础设施会从 SDK 竞争转向运行时竞争。 后台任务、权限审批、工具网关、审计、凭证轮换会变成标配。谁能把这些做稳,谁更容易进入企业核心流程。
  3. 媒体生成模型会被平台入口重新定价。 独立模型榜单仍有价值,但 Instagram、WhatsApp、Meta AI 这种分发入口会决定创作者实际使用频次。
  4. AI 基建采购会从 GPU 清单扩展到整机房清单。 CPU、内存、网络、电力合同和调度系统会进入同一张成本表。只盯 GPU 单价,已经不够。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel