一百万颗处理器当一台计算机:华为发布 Peerium,同一天说产能不够

一百万颗处理器当一台计算机:华为发布 Peerium,同一天说产能不够

华为全联接大会的官方文本在同一天落地:一套叫 Peerium 的计算架构、一张昇腾 960 超节点的规格表,以及轮值董事长徐直军在记者会上说的「连中国市场的需求都满足不了」。本文逐条核对官方数字与英文媒体转写之间的落差。

今天下午,The Information 用一句话概括了这场大会:华为把新芯片的发布时间提到 2027 年第一季度,比原计划早九个月;同一段里还写着,这颗叫 Ascend 960DT 的芯片性能将是上一代的两倍1
这篇简讯的标题写得更直白:加快发布是为了挑战英伟达。同一天,路透的标题用的是同一个判断214
到下午为止,英文报道里的中国 AI 芯片故事,还是「提前、翻倍、追赶」这几个词。
同一个下午,华为官网一次上架了五篇官方稿,其中两篇是主题演讲的全文——华为副董事长、轮值董事长汪涛,华为常务董事、ICT 业务集团 CEO 杨超斌——另外三篇是产品稿3。这场 9 月 17 日在上海开幕的华为全联接大会,会期三天4
官方文本的重点不在「提前」上。它给一套新的计算架构起了名字,叫 Peerium,功能描述是「一百万颗处理器成为一台计算机」5
也是今天,路透记录了华为轮值董事长徐直军在记者会上的一段话:华为造不出足够多的 AI 计算设备满足中国市场的需求,正在限制海外销售15
同一天的两份文本,一个讲架构能把规模做到多大,一个讲它现在能造出多少。

01|这次发布的主角不是芯片

超节点这个词,指把许多张 AI 芯片用高速互联拼在一起、共享内存、逻辑上当一台机器用的计算系统。今天发布的主角从芯片换成了造这种系统的架构16
Peerium 是华为给这套架构起的名字。官方稿把它拆成三项技术特征:嵌套并行、统一内存寻址、平等互联16
官方稿对这套架构的定性写得很重,说它突破了图灵范式,提出了 Nested BSP(嵌套整体同步并行),突破了冯·诺依曼单机架构,也颠覆了长久以来的主从架构16
把这几句翻译成一句白话,它要说的是:以前一台机器里的处理器有主有从,现在所有处理器平起平坐,谁都能访问全部内存16
官方稿没有给出支撑这几句的测试数据、论文或第三方复现。
能落到具体对象上的,是同一篇稿子的下一句:Peerium 的首代产品是 Atlas 950 超节点,25.6 万卡的 Atlas 950 超节点集群已经在部署中;基于 NPO(近封装光学)的 Atlas 960 系统正在测试中16
把这些机器连起来的技术叫灵衢(UnifiedBus)。官方对它的描述是「基于一个开放协议,可无限扩展地联接 CPU、NPU、内存、SSD、网卡和交换机」——「无限扩展」说的是端口、距离还是节点数,稿子里没写16
华为为什么要把「连起来」当成产品来卖,杨超斌的演讲给了一组数字:传统架构下集群越大、资源利用率越低,十万卡集群的模型浮点算力利用率(MFU,即一颗芯片标称的算力里真正用在计算上的比例)只有约 20%,大量算力在等通信6
汪涛给的是需求那一侧的数字:十万卡集群已经是训练十万亿级模型的标配17
华为还给自己的解法配了一组仿真:同样组成的十万卡集群,用 4096 卡超节点组网的那一套,算力利用率是 8 卡服务器那一套的 2.75 倍,数据来自华为马尔科夫实验室的仿真17
华为把竞争的计量单位从单颗芯片换成了整个集群:先承认大量算力花在等通信上,再把「把通信修好」当成产品来卖。

02|两张规格表,两个名字

今天官方给昇腾 960 超节点的规格是:单个超节点 4096 卡,最大 8E FP8、16E FP4 算力,1PB(约合一百万 GB)的 HBM 容量7
8E 里的 E 指 exa,8E FP8 相当于每秒八百亿亿次的 FP8 算力;FP8 与 FP4 指数据精度格式,位数越低,同样面积的芯片每秒能算的次数越多,代价是精度下降;HBM 是配套加速卡的高带宽内存,容量决定一个大模型能不能整块装进来18
规格里最新的零件是 Hi-ONE:一枚 NPO(Near-Packaged Optics,近封装光学)光引擎,单枚传输容量 7.2T(每秒 7.2 太比特)。官方称它是业界首个量产的 NPO 产品、目前行业传输能力最大,也是唯一实现内置光源的 NPO 产品18
这笔账官方算得很具体:5500 枚 Hi-ONE 替代原本需要的 4 万 8 千颗 800G 光模块,功耗降低超过 550 千瓦,系统无故障运行时间提升一倍,可用度 99.8%18
芯片那一侧的时间表,也第一次由公司自己写下:昇腾 960 研发进度超出预期、性能实现倍增,960DT 比原计划提前三个季度、2027 年第一季度就绪,960PR 比原计划提前一个季度、2027 年第三季度就绪17
一年一代的节奏不变,970 与 980 分别排在 2028 年和 2029 年17
对照一下就清楚了:英文媒体说的「早九个月」,和官方说的「提前三个季度」,是同一件事1417
问题出在名字上。
一年前那份演讲全文里,这个超节点的写法是:Atlas 960 超节点最大可支持 15488 卡,由 176 个计算柜与 44 个互联柜组成,上市时间 2027 年四季度8
今天的产品稿写的是「昇腾 960 超节点」,可扩展至 4096 卡18
同一个下午的架构稿,又把它写成「基于 NPO 的 Atlas 960 系统正在测试中」16
三处说法并存:两个名字,两个卡数,两种状态。官方今天没有解释它们之间的关系。
规格表落地之后,能核到的是单超节点 4096 卡;核不到的是这张表跟一年前那张 15488 卡的表怎么接上。
产品页也还没跟上。昇腾社区的处理器页上只有 Ascend 950PR 与 Ascend 950DT 两个名字,能打开完整规格的是 950PR,950DT 只有一个名称,960 在这一页上没有位置9
另一个今天被补上的数字是交付量。汪涛在演讲里说,昇腾 910C 超节点已部署超 1000 套,昇腾 950 超节点也已规模商用17
路透的英文写法是「超过 1000 套使用较早期 910C 处理器的系统」15
中文侧流传的版本换了一个主语:界面新闻转载的现场快讯写的是「昇腾超节点已部署 1000 多套,客户包括 370 多家」10
官方文本站的是前一种:主语是 910C 这个具体型号,不是把各代都算进去的「昇腾超节点」这个品类。至于「370 多家客户」,今天官网的五篇稿子里找不到对应项19

03|记者会上的另一个版本

路透那篇稿子里,徐直军说的是另外三件事。
第一件是产能。他说中国的需求都满足不了,所以没有全面进入国际市场的计划;对需求特别强的少数国家有供应,但量有限15
路透记录的英文原话是:「Since we don't have enough capacity to even satisfy the demand in China, we don't have a plan to expand into the international market in a fully-fledged way.」15
第二件是自给。他说不能接受自己的命运取决于别人愿不愿意卖芯片给中国;无论对中国政府、中国产业还是对华为,争取芯片的完全自给都是必须走的路15
第三件是份额。他说昇腾的市场份额应该比英伟达更大——路透紧接着写了一句,华为没有提供数据来支持这个估计15
同一篇稿子里还有一条来自公司内部的信号:华为监事会主席郭平在本周公开的员工讲话中说,公司把 AI 视为「最大的机会」,希望自己的计算与联接基础设施发挥与英伟达相当的作用15
被点名的第一颗芯片是昇腾 950DT。徐直军说这颗芯片的测试结果良好,公司正在与中国的大模型开发者广泛讨论,预计明年会有很多开发者开始在采用这颗芯片的系统上训练模型15
这三件事目前只能回到路透那一篇里去核:华为官网的五篇稿子没有问答环节,中文报道里也找不到它们的对应表述1519
还有一个容易读混的地方。华为的轮值董事长由几位高管按六个月一轮轮流当值,头衔本身由多人持有;今天的两篇官方稿里,汪涛写作「副董事长、轮值董事长」,徐直军写作「轮值董事长」,英文媒体把两人都译成 rotating chairman151617
软件那一侧,官方给出的数字是:CANN 的外部开发者首次超过内部开发者、占比 61%,社区月活开发者突破 5200 名;基于昇腾与 CANN 的原生训练模型超过 40 个;昇腾已成为 PyTorch 官网可直接安装的算力平台,也是首个来自中国的算力平台17
CANN 是昇腾的软件栈,英伟达那一侧对标它的是 CUDA17
「挑战英伟达」四个字写在英文标题里;华为自己今天给出的版本是产能不够、先满足中国市场的需求。

04|「百万卡」这个数字,分三层

今天所有关于规模的数字,都要先看清是哪一层。
第一层是已经在发生的:25.6 万卡的 Atlas 950 超节点集群,官方写的是「已经在部署中」16
第二层是组网能到的:多个昇腾 960 超节点用灵衢网络或 RoCE 连接,通过二层 CLOS 四平面组网,最大集群规模可达到 51.2 万卡1718
第三层是理论上限:再结合多轨道拓扑技术,最大可支持 100 万卡昇腾超节点集群1718
三个数字的主语和状态都不一样:一个在部署中,一个是组网能达到的规模,一个是「最大可支持」。
这三个数字既不能相减,也排不成一条增长曲线;它们是同一套系统在三种条件下的容量上限。
前面出现过的三组效率数字——通信占用、集群利用率、超节点带来的提升——出处都是华为自己的材料与仿真,目前没有第三方复现1720
需求那一侧还有一组可以放在一起看的数字。汪涛说,中国每天的推理词元已经增长到 500 万亿左右17
国家数据局局长刘烈宏今年 3 月在国新办发布会上给出的数字是,我国日均词元调用量超过 140 万亿11
两组数字都是词元口径,但一边出自国家数据局、一边出自华为,两边都没有说明能否直接相减。
英伟达那一侧也能量到「域」这一层。它 2026 年 3 月的官方博客写:刚进入全面量产的 Vera Rubin NVL72,是把 72 颗 GPU 用一个 NVLink 域全互联起来,出货排在 2026 年下半年;再往后一代,是跨八个机柜、两层全互联的 Vera Rubin Ultra NVL57612
同一家公司的季报(财季截至 2026 年 7 月 26 日)写,虽然它还能向中国出货游戏与工作站 GPU 这类不受管制的产品,但在中国的数据中心计算市场「已被有效排除」(effectively foreclosed),被美国的出口管制排除在外13
两边的数字单位不同:一个昇腾 960 超节点是 4096 卡,一个英伟达 NVLink 域是 72 颗 GPU。这两个数字量的是各自「一台计算机」的范围,不是单颗芯片的性能。
说法现在能核到什么差在哪
「提前九个月」发布14官方同日:960DT 比原计划提前三个季度、2027 年一季度就绪,960PR 提前一个季度、2027 年三季度就绪17两种写法说的是同一件事:相对华为自己 2025 年 9 月那张路标,960DT 提前了三个季度;「性能是上一代的两倍」出自英文媒体对汪涛发言的转写,官方原话是「性能实现倍增」,没有给基准1417
Peerium 让一百万颗处理器成为一台计算机16官方给出的首代产品是 Atlas 950 超节点,25.6 万卡的 Atlas 950 超节点集群「已经在部署中」16「突破图灵范式」「颠覆主从架构」是华为自己的定性,官方稿没有附测试数据、论文或第三方复现
昇腾 960 超节点:单超节点 4096 卡、8E FP8、1PB HBM18一年前的官方路标写的是 Atlas 960 超节点「最大可支持 15488 卡」21;同日架构稿又把「基于 NPO 的 Atlas 960 系统」写成正在测试中16两个名字、两个卡数、两种状态并存,官方今天没有解释它们如何对应
昇腾 910C 超节点已部署超 1000 套17路透的英文写法是「超过 1000 套使用较早期 910C 处理器的系统」15主语是 910C 这个具体型号,中文快讯把它换成了「昇腾超节点」这个品类22;「370 多家客户」在官网五篇稿里找不到对应项19
中国每日推理词元约 500 万亿17国家数据局 2026 年 3 月的口径是日均词元调用量超过 140 万亿23两组数字出自不同机构、不同统计,相差半年,能否直接相比两边都没有说明
官方稿里那张芯片表排到了 2029 年,离现在最近的一格是今年四季度的昇腾 950DT——徐直军今天给它的说法只有四个字:测试良好1521
架构稿写的是「一百万颗处理器成为一台计算机」。要让第一百万颗真的连进去,先得让产线跟上。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content