算力涨价,模型降价:AI 的两张成本表

算力涨价,模型降价:AI 的两张成本表

九月十七日,一家做算力租赁的公司给客户发了一封信,通知他们从十月一号起,租它家显卡的按需价格要涨,涨幅最高两成。

0:00 / 10:34
九月十七日,算力租赁公司 Nebius 通知客户,从十月一日起上调按需 GPU 算力价格,涨幅最高两成。同一天,亚马逊用一份最高八十亿美元的长期协议锁定备用发电机产能,智谱披露在十万张国产芯片上让智能体优化自己的推理系统,Anthropic 公布它内部已有多少研发由 Claude 主导。这一周里,算力和电在变贵,模型调用的价格在变便宜。这期把两条线放在一起,看 AI 的成本结构正在怎么重排。

涨的那一端:显卡按小时涨了价

Nebius 是一家在纳斯达克上市的算力租赁公司,主业是把英伟达的显卡按小时租给 AI 公司。据它 9 月 17 日发给客户的通知,10 月 1 日起按需价格调整:H100 从每小时 3.85 美元升至 4.50 美元,涨幅约 17%;H200 从 4.50 升至 5.40,涨幅 20%;B200 从 7.15 升至 8.50,涨幅约 19%;最新的 B300 从 7.85 升至 9.50,涨幅约 21% 1。除显卡外,配套的 AMD EPYC Genoa 处理器费率上调 25%,Genoa 内存费率上调约 41%。旧价格可在 Nebius 官方价格页核对 2
这已经是年内第二轮。5 月那一轮,按需容量平均提价 29%,可抢占容量提价 51%;把两轮叠加,B300 比 5 月之前贵了约 56% 3
涨价背后是供需。据华尔街见闻报道,Nebius 管理层称需求之强使手动调价已不足以平衡供需;公司还拿稀缺的 Blackwell 算力做过拍卖测试,客户实际支付价格比原最高定价高 15% 至 20%。更直接的指标是需求能见度:从此前约 18 个月拉长到 24 个月以上,已有客户预订 2028 年一、二季度算力,部分订单涉及数万块 GPU。同一篇报道提到,算力短缺正在改变数据中心的合同谈判生态,过去偏向大客户的极端惩罚条款开始松动 3。9 月 17 日美股盘前,Nebius 涨约 8%,CoreWeave、IREN 等同业同步走高。

钱开始流向发电机

9 月 16 日,发电设备公司 Generac 向美国证监会提交文件,宣布与亚马逊签订长期供应协议,为亚马逊的数据中心供应备用发电机 4。按公开披露,这项合作累计采购额最高可达 80 亿美元,其中 2027 至 2028 年交付的首批约 24 亿美元 5
亚马逊拿到的不只是货。按协议,它可以按每股 200.93 美元认购最多 1,693,745 股 Generac 普通股,按行权价算约 3.4 亿美元;约 30.8 万股立即归属,其余按累计采购额分批归属,全部归属对应 80 亿美元的采购门槛。消息公布当天,Generac 股价盘中一度涨超三成 6
值得注意的是交易的形式:上一周,亚马逊用同样的方式绑定了高通的定制 AI 芯片,也是长期订单加认股权证。巨头在用股权锁定产能,而这类支出正在从芯片、服务器扩散到发电机、电网与储能。

英伟达:瓶颈不在需求,在产能

9 月 17 日,黄仁勋在苏格兰出席由英国国王查尔斯三世主持的一场 AI 峰会,其间对媒体表示:「我预计英伟达明年卖出去的芯片数量,是今年的两倍。」他的理由是 AI 正在进入医疗、制造、金融等行业,几乎每个开展业务的国家都想投资 AI;同时他承认,当前的瓶颈不在需求而在产能,出货取决于供应链扩张速度 7
这个说法比公司自己的指引更激进:8 月底的财报会上,英伟达预计截至 2028 年 1 月的财年营收增长约 70%,约 6,730 亿美元,并称若供应跟得上,营收有机会翻倍。英伟达并不披露芯片总销量,上一次给出具体数字是去年秋天称四个季度出货 600 万颗 Blackwell GPU。同一场峰会上,黄仁勋还表示,不安全的成品应当先暂缓发布,AI 是底层技术,监管应落在具体产品上。

中间那一层:用效率换算力

9 月 17 日,智谱创始人兼首席科学家唐杰在 X 发布长文并转发公司技术博客,披露其在递归自我改进(RSI)方向的第一个工程实践:由 GLM-5.3 驱动的 Infra Agent 参与完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化 8
按博客披露,这套生产级推理服务从零搭建在超过 10 万张国产 AI 加速器组成的集群上;芯片显存与带宽有限,还要支持新模型架构、100 万 Token 上下文与多模态请求。优化过程中,智能体自己读运行数据、提假设、改代码、跑对照实验:它定位到 KV 传输与计算未能并行,追到 DeepEP 的 Python/C++ 边界没有释放全局解释器锁,修复后把 Prefill 加 KV 传输相对单独 Prefill 的性能损耗从超过 20% 压到 1% 以内。从第一次跑通到承接全部生产流量用时不到两周,端到端吞吐提升到初始基线的约 3 倍,硬件利用效率与单 Token 成本达到主流英伟达 GPU 的相当水平。GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode、OpenRouter 上线,六天内处理超过 62 万亿 Token。唐杰在文中强调,让循环转起来的是闭环:工程师定目标与边界,智能体做分析与修改,实验环境提供可分层追溯的反馈;他也表示距离完全递归自我改进还很远。
同一天,Anthropic 公布了一套衡量前沿实验室研发速度的指标,并给出内部快照 9。截至 2026 年 8 月:Claude 已「主导」(AL4,即按高层提示端到端完成大部分任务、人类只做监督)约 26% 的 AI 研发工作,达到「AI 协作」(AL3)及以上的占比超过 90%;该比例在 2026 年 2 月还不到 1%;没有任何被测工作达到完全自主(AL5)。同年 8 月,约 3 万个智能体在该公司最常用的内部平台上从事研究与工程;对超过 10 亿次智能体决策的统计显示,约 0.002%(约每 4.7 万次一次)被在线监控拦截。7 月 13 日至 20 日一周,AI 研发算力中约 6% 投入安全研究;若只统计由 AI 驱动的研发,该比例约 12%。Anthropic 同时说明局限:各实验室尚无统一口径,横向比较不成立;用自家模型评估自家系统,评估模型与被评估模型可能犯相似的错误。

跌的那一端:模型调用的价格

9 月 18 日,阿里千问发布原生全模态模型 Qwen3.8-Omni-Flash:支持文本、图像、音频、视频四类输入,上下文 100 万 Token,原生支持最长 1 小时连续音视频输入;官方称每小时音频输入的 API 价格下降超过 98%,音视频输入下降超过 93% 1011。官方称该模型在 30 项评测中比上一代 Qwen3.5-Omni-Plus 平均提升超过 26%,也承认在部分视频理解测试中仍不及 Gemini 3.8 Flash。发布中还有一个与 RSI 同方向的细节:让新模型在 12 小时内提升 Qwen2.5-Omni-3B 的四川话识别能力,它自主选定评测集,经 4 轮实验构建 3,413 条训练数据,字符错误率从 25.79% 降至 15.30%。

三个观察点

涨价能不能被接住。 10 月 1 日生效的新价格,客户是照单全收还是转向别家,是对算力紧缺最直接的一次检验。
电能不能按期到位。 80 亿美元的发电机订单要落在 2027 至 2028 年的交付上;电力跟不上,买回来的芯片也开不了机。
比例上升之后谁来做验证。 如果「AI 主导的研发占比」继续往上走,Anthropic 提出的第三方评估、跨实验室可比的口径,才会成为真正的问题。
把这一周放在一起:算力与电力这一端在涨价,模型调用那一端在降价;两边之间,能拉开差距的是谁把每一份算力用得更满。
本期内容依据公开报道与公开文件整理。需要说明证据强度:Nebius 的价格来自其发给客户的通知,旧价格可在官方价格页核对;亚马逊与 Generac 的金额与权证条款来自公司向美国证监会提交的文件及公开报道;黄仁勋的销量预测、智谱与 Anthropic 公布的比例、阿里的评测结果,均来自各公司自己的披露。它们说明的是方向,不是已经落地的结果。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content