
AI 全景情报 0708:模型主权、Agent 后台和推理底座同时变硬
本期聚焦中国与乌克兰的模型主权信号、DeepSeek 推理芯片、Google 与 Claude 的后台 Agent、Meta Muse Image,以及 NVIDIA Vera CPU 与美国电力需求,判断 AI 竞争正在从模型能力延伸到部署控制权、运行时和推理基础设施。
7 月 8 日早上的 AI 信号很集中:前沿模型开始被当作可管制资产,Agent 产品从「聊天窗口」变成长任务后台,推理负载则把 CPU、电力和本地部署重新推到采购桌面上。对 AI 团队来说,接下来几个月的关键问题不只是「哪个模型更强」,而是模型能不能在你控制的环境里跑、Agent 能不能安全接工具、推理底座能不能承受连续工作负载。
| 信号 | 发生了什么 | 对 AI 从业者意味着什么 | 接下来盯什么 |
|---|---|---|---|
| 模型主权 | 中国监管部门据报道正讨论限制海外访问最先进国产 AI 模型;乌克兰也明确偏好可在本国基础设施运行的模型。12 | 便宜、可下载、跨境可用这三件事可能不再同时成立。企业选型要把权重、托管区、出口限制写进模型采购清单。 | 中国是否给开源权重分级;欧洲政府采购是否要求本地托管。 |
| 推理芯片 | DeepSeek 正在早期研发面向推理的自有 AI 芯片,已接触芯片设计、代工和内存伙伴。3 | 模型公司继续向硬件下沉,重点不是训练大芯片,而是更便宜、更可控的推理。 | 是否拿到先进制程与 HBM;第一代芯片先服务自用还是对外售卖。 |
| 托管 Agent | Google 给 Gemini API 的 Managed Agents 加入后台执行、远程 MCP、函数调用和凭证刷新;Claude Cowork 同日扩展到 web 与移动端。45 | Agent 产品的交付标准正在变成「异步、可恢复、可审批、可接内部工具」。只会同步问答的产品会显得像半成品。 | 背景任务的权限边界、审计日志、工具调用失败恢复。 |
| 生成媒体 | Meta 发布 Muse Image,并预告 Muse Video;Muse Image 接入 Meta AI、Instagram Stories 和 WhatsApp,带搜索、代码工具、自我修正与 Content Seal 水印。6 | 图像模型竞争从「一次生成质量」转向「社交分发、广告素材、可追溯标记」。创作者工具会被平台入口吃掉一部分。 | Muse Video 何时开放;Content Seal 是否被广告主、平台审核和创作者接受。 |
| 推理底座 | Perplexity 确认计划使用 NVIDIA Vera CPU;EIA 预计美国用电量 2026、2027 年继续创高,AI 数据中心是主要推力之一。78 | Agent 连续运行会消耗 CPU、内存、网络和电力,不只是 GPU。基础设施团队需要重新算单位任务成本。 | Vera 的真实采购量;数据中心电力合同和商业用电增速。 |
1. 模型主权从口号变成采购约束
中国这条线的变化,比单个模型发布更影响下游选型。Reuters 称,中国商务部牵头的会议讨论了对最先进 AI 模型设置海外访问限制,范围可能覆盖闭源模型和更开放的版本;参会公司包括 Alibaba、ByteDance 和 Z.ai。报道还提到,相关限制仍在讨论中,可能只适用于未来模型。1
这会直接改变海外团队对中国低价模型的预期。过去半年,不少开发者把 Qwen、Doubao、GLM 等模型看作压低推理成本的替代选项。若未来高端模型需要安全审查、国内使用或更严格备案,成本优势还在,供应确定性会下降。最容易受影响的是把单一境外 API 当核心依赖的产品,尤其是客服、内容生产、代码辅助这类高调用量业务。
乌克兰的表态从另一个方向补上了同一件事。乌克兰数字化转型部首席 AI 官 Roman Kyslyi 称,乌克兰会优先选择可在自有服务器上运行的 AI 系统,核心不是模型来自哪里,而是供应商能不能让模型部署在乌克兰控制的基础设施上。该国 Diia 政务应用里的 AI 助手目前使用位于欧盟服务器上的 Gemini,但这是「interim」方案,乌克兰还在基于 Google Gemma 与 Kyivstar 开发自有模型,计划秋季发布。2
对从业者的含义很具体:模型评估表里要增加「部署控制权」这一列。API 延迟、价格、基准分数还不够,政府、金融、军工、医疗和跨境 SaaS 还要问四个问题:权重能否本地持有,日志是否出境,供应商能否远程关停,监管变化后是否有替代路径。
2. DeepSeek 走向推理芯片,说明模型公司不想只租算力
Reuters 报道称,DeepSeek 正在研发自有 AI 芯片,目标是推理而非训练;项目仍处早期,DeepSeek 已接触外部伙伴,并在私下招聘芯片设计工程师。DeepSeek 未回应置评请求。3
这不是「又一家 AI 公司造芯」这么简单。推理芯片的商业逻辑和训练芯片不同:训练看峰值算力和集群规模,推理更看单位 token 成本、功耗、内存带宽和持续供货。DeepSeek 的模型路线一直强调低成本推理,如果它能把模型结构、编译栈和芯片特性绑在一起,就有机会把成本优势固化到硬件层。
阻力也很硬。Reuters 提到,华为在中国 500 亿美元 AI 芯片市场中已拿到约一半份额,但其产品与 NVIDIA 最先进芯片仍有差距;DeepSeek 若要做自有芯片,还会遇到先进代工和高带宽内存限制。3
工程团队不必马上为「DeepSeek 芯片」改路线,但要把一个趋势放进成本模型:头部模型厂商会继续把推理栈往下扎。未来的竞争不会只发生在 API 价格表上,也会发生在编译器、内存布局、批处理策略和芯片供给优先级里。
3. Agent 进入后台工作流,产品形态开始定型
Google 的 Managed Agents 更新,把开发者最痛的几个工程点放到了台面上:后台执行支持长任务异步运行;远程 MCP 让 Agent 从安全沙箱连接内部数据库或 API;自定义函数调用允许本地业务逻辑参与;凭证刷新则解决短期 token 过期和网络规则替换。Google 的说法是,开发者只调用一个 endpoint,Gemini 处理推理、代码执行、包安装、文件管理和网页信息,运行在隔离云沙箱里。4
Anthropic 则从用户端推进同一方向。Claude Cowork 开始向 mobile 和 web 推出,先给 Max 用户开放 beta;官方称任务可在设备离线后继续运行,需要人判断时会把问题推到手机,用户确认前不会发送结果。Anthropic 还披露,Cowork 超过 90% 的使用不是软件开发,业务运营和内容创建合计约占一半。5
这两条合在一起看,Agent 的 MVP 标准已经变了。去年很多产品还在展示「它能打开浏览器、点按钮、写文档」。现在企业客户会追问:任务跑到一半断线怎么办,谁批准对外发送,凭证怎样轮换,哪些工具能被调用,失败状态能不能复盘。
对应用团队来说,Agent 的价值不在于替用户多聊几轮,而在于接住那些跨文件、跨系统、跨时间段的杂活。产品经理要把「开始任务」「挂起任务」「请求人工确认」「恢复任务」「审计任务」做成一等功能,而不是藏在聊天记录里。
4. Meta 把图像模型接进分发入口,生成媒体进入平台战
Meta 发布 Muse Image,并预告 Muse Video。官方称 Muse Image 是 Meta Superintelligence Labs 的首个图像生成模型,可调用搜索和代码工具、进行自我修正,并与 Muse Spark 协同;产品层面已接入 Meta AI app、meta.ai、美国的 Instagram Stories 和部分国家的 WhatsApp,Facebook 也在后续计划内。6

这里最值得看的是分发位置。Muse Image 不是只放在一个独立生成器里,而是进入 Instagram Stories、WhatsApp 聊天和 Meta AI。对创作者和小商家来说,这比单纯模型榜单更重要:素材生成、发布、反馈、再创作都在同一个平台内完成,平台知道你的社交关系、账号语境和广告目标。
Meta 还给 Muse Image 加了 Content Seal 隐形水印,并预告未来扩展到视频。6 如果这个机制被平台审核、广告投放和创作者工作台采用,生成内容的竞争会多出一条新轴:不只是画得好,还要能证明来源、能被平台识别、能在商业内容里安全使用。
5. Agent 负载把 CPU 和电力推到前台
Perplexity 确认计划使用 NVIDIA 的 Vera CPU。NVIDIA 此前称,预计 Vera CPU 在本财年结束前带来 200 亿美元销售;Perplexity 负责计算企业与基础设施的副总裁 Nate Kupp 称,Vera 在 AI agent coding tasks 上比传统 CPU 快约 1.5 倍。Perplexity 没披露采购数量。7

这解释了为什么 CPU 又被拉回 AI 讨论。Agent 不像人类用户那样在任务之间休息,它会持续读文件、跑工具、调网络、写代码、检查结果。GPU 负责模型推理的一部分,但大量编排、检索、代码执行和数据搬运会落到 CPU、内存和网络上。单看 GPU 利用率,容易漏掉真实瓶颈。
电力侧也在给同一个结论加压。美国能源信息署预计,美国用电量会从 2025 年的 4.195 万亿千瓦时升至 2026 年的 4.269 万亿千瓦时、2027 年的 4.399 万亿千瓦时;增长主要来自 AI 数据中心、加密计算和电气化。EIA 还预计,2026 年商业部门用电需求将首次超过居民部门。8
这对基础设施团队的提醒很直接:下一轮降本不是只谈「换更便宜的模型」。要把任务拆到 CPU 秒、内存带宽、网络出入、工具调用失败率、机房电价和排队时间。Agent 越像后台员工,成本模型就越像运营模型。
风口判断
- 可本地部署的高能力模型会继续升温。 政府、金融和跨境企业会把 on-prem、私有云、区域云作为默认要求,开源权重和可控推理栈的商业价值会上升。
- Agent 基础设施会从 SDK 竞争转向运行时竞争。 后台任务、权限审批、工具网关、审计、凭证轮换会变成标配。谁能把这些做稳,谁更容易进入企业核心流程。
- 媒体生成模型会被平台入口重新定价。 独立模型榜单仍有价值,但 Instagram、WhatsApp、Meta AI 这种分发入口会决定创作者实际使用频次。
- AI 基建采购会从 GPU 清单扩展到整机房清单。 CPU、内存、网络、电力合同和调度系统会进入同一张成本表。只盯 GPU 单价,已经不够。
参考ソース
- 1Beijing is looking at curbing overseas access to China's top AI models, sources say
- 2Ukraine to pick AI models operated without provider control, official says
- 3China's DeepSeek developing its own AI chip, sources say
- 4What’s new in Managed Agents in Gemini API
- 5Claude Cowork on web and mobile: hand off work anywhere
- 6Introducing Muse Image and Muse Video
- 7Perplexity says it plans to use Nvidia's new CPU
- 8US power use to beat record highs in 2026 and 2027 as AI use surges, EIA says
関連コンテンツ
- ログインするとコメントできます。
