AI推理不再只拼GPU:芯片、内存与路由开始争夺每次调用的成本

AI推理不再只拼GPU:芯片、内存与路由开始争夺每次调用的成本

AMD Helios、Intel数据中心CPU、Etched推理芯片与Runway模型路由的最新动作显示,AI基础设施竞争正在从单点GPU性能转向整套推理系统的吞吐、内存、调度和单位任务成本。

今日新模型发布

截至 7 月 24 日 21:00,尚未核实到当天新的基础模型或重大基础模型版本发布。今天检索到的两条高热产品更新,一条是 Anthropic 把 Claude 语音模式扩展到 Opus 和 Sonnet,并接入 Gmail、Slack 等应用;另一条是 OpenAI 把 ChatGPT Health 扩大到美国用户,允许连接医疗记录和健康追踪信息。它们改变的是功能入口和可用范围,不应计入新模型发布。1 2
最近一个已核实的模型级发布周期仍是 Google 在 7 月 21 日推出的 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。3.6 Flash 面向编码、知识工作和多模态任务,API 价格为每百万输入 token 1.50 美元、每百万输出 token 7.50 美元;Flash-Lite 面向低延迟、高吞吐和代理搜索,价格为 0.30 美元和 2.50 美元;Cyber 只向政府和受信任合作伙伴提供有限试点。这里最值得留意的不是又多了三个型号,而是模型供给已经直接绑定到推理成本和部署权限。3

一张表看懂今天的新增信号

信号已核实事实状态与边界
机架级推理系统AMD 称 Helios 已进入生产状态。OpenAI 计划从 2026 年第四季度开始上线,Anthropic 计划部署最多 2GW 的 MI450 系列 GPU,首个 1GW 计划于 2027 年上半年开始;Meta 仍在实验室验证和测试工作负载Helios 进入生产不等于客户已完成大规模部署,Anthropic 和 OpenAI 的数字仍是未来计划 4 5
推理专用芯片Etched 完成 3 亿美元 Series C,估值 103 亿美元;公司称新组件分别优化 prefill 和 decode,并通过共享内存池降低延迟主要仍在小范围测试到量产交付的过渡期,访问权限有限,实际规模化效果尚未充分验证 6
模型路由Runway 推出 Media Router,按照质量、速度和成本偏好,在自有及第三方图像、视频、音频模型之间自动选择,并采用 token 计价路由层开始直接决定一次任务把调用分给谁,但不等于路由商已经掌握模型质量或客户毛利 7
CPU 与内存Intel 称数据中心 CPU 采用增加,AI agent 的多步骤工作负载正在推高需求;Reuters 同时报道中国存储芯片厂商受 AI 数据中心扩张推动,定价权和资本市场关注度上升推理瓶颈不只在加速器,CPU、内存、互连和供给稳定性也会进入交付评估 8 9

GPU 之外,推理系统开始被重新定价

过去两年,AI 基础设施的讨论经常被压缩成一个问题:谁能拿到更多 GPU。今天的新增信息把这个问题拆开了。模型调用先要完成 prefill,把输入上下文变成可计算状态;随后进入 decode,逐步生成 token。长上下文、工具调用和多步 agent 任务会让这两个阶段的瓶颈不同,内存带宽、互连延迟、CPU 调度和电力都可能决定一次任务的总成本。
AMD 的 Helios 正是在这个方向上竞争。AMD 把多个处理器组合成数据中心的 rack-scale 系统,并称该系统面向训练和运行前沿模型。官方披露的客户状态也很有区分度:OpenAI 是从 2026 年第四季度开始上线,Anthropic 是最多 2GW 的部署计划,Meta 还在实验室验证。这意味着采购方拿到的不是一张简单的「客户名单」,而是三种不同的可用性:已经进入生产、计划部署、测试验证。4
Anthropic 的合作公告还给出一个更具体的时间边界:最多 2GW 的 MI450 系列 GPU 将放进 Helios,首个 1GW 计划在 2027 年上半年开始部署。这个数字足以说明大模型公司正在把算力采购延伸到机架和数据中心层,但它仍然是未来部署计划,不能写成已经上线的推理容量。5

省下 token,不等于省下任务成本

Etched 的融资说明,资本市场正在押注另一条路径。TechCrunch 报道,这家公司完成 3 亿美元 Series C,估值达到 103 亿美元。Etched 称自己做了两类推理组件:一类针对 prefill,另一类针对 decode,并把多芯片连接到共享内存池,以降低访问延迟。这个设计把竞争从「通用 GPU 能跑什么」推进到「特定推理阶段如何把硬件利用率做高」。6
但这条故事还没走到交付终点。报道提到,Etched 的访问权限目前主要给投资人和早期客户,产品仍在从小范围测试走向量产交付。它声称可以运行包括 Mixture of Experts 和非 Transformer 架构在内的模型,仍需要更多客户现场数据来证明通用性。对芯片创业公司来说,单次 benchmark 的速度和融资估值都不够,真正要看的数字是持续吞吐、故障率、迁移成本、软件兼容性和每次成功任务的总电费。
Intel 的消息则提醒市场,agent 时代可能会让 CPU 重新变得重要。Reuters 报道,Intel 预计第三季度营收高于华尔街预期,数据中心 CPU 采用增加,AI agent 的多步骤任务推高了相关需求;公司高管还称订单增长快于产能。agent 每完成一次任务,往往要反复读取数据、调用工具、执行检查和整理结果,这些环节不会全部由 GPU 完成。8
这给企业算账带来一个实际变化:模型报价单上的输入和输出 token 价格只是变量之一。等待时间、重试次数、工具调用、内存占用、人工复核和失败后的返工,决定的是一次任务能否真正交付。Google 的 Flash 系列已经把「更少 token」和「更少工具调用」写进模型卖点,但企业仍需用自己的任务集验证总成本,不能把厂商基准直接当作财务结论。3

路由层开始争夺模型层之上的利润

Runway 的 Media Router 把这件事推到了软件层。它通过 Runway Dev 接入越来越多的图像、视频和音频模型,开发者可以把偏好设为质量优先、速度优先或成本优先,由路由器自动选择模型。Runway 还改用 token-based pricing,并向 Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock 和 Quora 等企业提供开发者服务。7
路由不是一个轻量的模型目录。它需要持续记录不同模型在真实任务中的质量、失败率、延迟和价格,再把这些结果转化为调度规则。客户如果只关心最低单价,路由器可能把请求推向便宜但返工更多的模型;如果只追求质量,又可能把成本和等待时间推高。谁掌握路由,谁就能看到一批请求在不同模型之间如何迁移,也更接近客户真正的任务级毛利。
这会改变模型公司的竞争方式。模型商仍然要争取直连客户,但企业未必愿意为每个模型维护一套接口、计费和质量监控。未来的供应商比较,不只看模型榜单,还要问能否被路由、路由规则是否可导出、故障时是否自动切换,以及客户能否拿到足够细的调用和成本账单。否则企业只是把模型锁定换成了路由锁定。

物理 AI 把系统账算得更细

物理 AI 是这条基础设施主线的压力测试。CnEVPost 援引媒体报道,Momenta 的 robovan 已在苏州运营数月,公司希望把自动驾驶能力从乘用车扩展到货运配送,并把平台覆盖到乘用车、robovan、robotruck 和 robotaxi;这些是报道中的运营和公司规划口径,不能直接等同于大规模商业交付。10
地平线在 7 月 24 日中国汽车论坛上展示了 Starry Series 中央计算平台,并把第四代 BPU 的方向指向通用机器人。论坛发言还提到其超过 1000 万套量产交付和 40 多家合作伙伴,但这是公司在活动中的口径,正文不把它写成机器人现场运行规模。11
自动驾驶和机器人会把硬件系统的缺陷直接暴露在现场:延迟不只是账单问题,还关系到接管;内存和互连不只是吞吐问题,还关系到传感器数据能否按时处理;路由策略也不能只追求便宜,还要受安全等级、地域和责任边界约束。物理 AI 的商业化,最终要落在客户现场设备数、连续运行时长、接管率、安全记录和单任务成本上。

给采购和投资的四个核对项

  1. 把推理拆成阶段。 分别测 prefill、decode、工具调用和数据访问,不用一个平均 token 价格代表全部成本。
  2. 把部署状态写进合同。 逐项标注生产、测试、计划部署和合作宣布,要求供应商提供交付批次、SLA、故障处理和扩容时间。
  3. 把路由当成基础设施。 核对质量、速度、成本三种策略能否切换,模型替换是否需要重做数据和提示词,调用账单能否导出到任务级。
  4. 把物理 AI 的销量换成运营数据。 设备数量和产能规划只能说明供给准备,决策应继续追踪现场运行、接管、安全和返工。
今天没有新的基础模型,但推理这条产业链已经出现了更清晰的分工:AMD 和 Intel 争的是整机与数据中心吞吐,Etched 押注 prefill、decode 和内存架构,Runway 把模型选择变成路由服务,Momenta 和地平线则把这些系统要求带到真实道路和车辆平台。下一轮比较 AI 供应商时,最该补上的一列不是「模型名称」,而是「一次成功任务的全部成本」。

相似内容

  • 登录后可发表评论。
More from this channel