🏢 公司C档 · NaN分

百万卡当一台机,华为赌上架构

··约1分钟阅读

📋 总体概括

9月17日,[[华为]]在上海发布AI时代全新计算架构Peerium,试图突破冯·诺依曼单机架构与主从体系,让百万级处理器协同为一台计算机。本文拆解其嵌套并行、统一内存寻址与灵衢互联三大支柱,并分析Atlas 950/960超节点背后的产业逻辑与生态博弈。

📄 正文

当所有人还在争论大模型参数涨到多少万亿时,华为选择从更底层动刀。

9月17日,徐直军在上海登台,发布了AI时代的全新计算架构 Peerium。按照官方口径,这个架构最激进的一点是:让百万级处理器像一台计算机那样协同工作。这不只是又一次性能升级,而是一次对冯·诺依曼体系与图灵范式的正面挑战。

算力军备竞赛打到今天,单点芯片的极限已经越来越近,谁能重新定义“计算机”本身,谁就握住了下一个十年的入场券。这是 Peerium 发布背后真正的分量。

🔧 冯·诺依曼的墙,AI先撞上了

每一代通用计算的繁荣,都是站在前人的架构地基上,而地基也会老。

先回到那个几乎每个学计算机的人都背过的定义:冯·诺依曼体系结构要求计算机按程序顺序执行,运算器、控制器、存储器、输入与输出系统各司其职。八十年里,这套分工模式撑起了从大型机到手机的一切。

但AI训练集群的工作方式,正在把这堵墙撞出裂缝。一个直观的场景是:训练一个超大模型,需要成千上万张卡一起算,而传统的主从架构意味着所有节点之间存在明确的控制与被控制关系,扩展规模越大,协调成本越高,单机的边界就成了集群的天花板。

华为在发布会上把话说得很直白:Peerium 架构“颠覆了长久以来的主从架构”,突破了传统图灵范式与冯·诺依曼单机架构的限制。(信源:华为全联接大会2025徐直军主题演讲[1])

这不是演讲话术里的“颠覆”,而是有明确技术指向的表述——问题出在组织方式上,所以解法也必须从组织方式下手。

维度冯·诺依曼单机架构**Peerium** 架构
执行方式按程序顺序执行嵌套并行,分层递归组织
节点关系主从关系贯穿其中平等互联
扩展边界单机为主,跨机靠外挂百万级处理器强扩展
互联范围运算器、控制器、存储器各司其职计算、存储与网络平等互联
关键技术传统总线体系灵衢 开放协议

🧩 三板斧:嵌套并行、统一寻址、平等互联

架构创新从来不是单点魔法,而是一套能互相咬合的机制设计。

Peerium 的技术内核可以拆成三件事:嵌套并行、统一内存寻址和平等互联。华为明确表示,这三者共同实现了百万级处理器的强扩展能力。(信源:华为发布会官方材料[1])

第一板斧是 Nested BSP——嵌套批量同步并行。要理解它的价值,得先回到经典 BSP(Bulk Synchronous Parallel,批量同步并行)模型:这一由图灵奖得主 Leslie Valiant 在上世纪90年代提出的范式(信源:Valiant, "A Bridging Model for Parallel Computation", Communications of the ACM, 1990[2]),把并行计算切成一个个"超步"(superstep),每个超步内各计算单元独立干活,超步之间全局同步一次。它牺牲了一部分流水线效率,换来了确定性和可调试性。

Nested BSP 做的,是把这套同步机制从“平面”改成“立体”——在超节点内部的卡间、节点间的机柜间、集群层面的超节点间,分别以不同粒度递归套用 BSP 节奏:最内层的同步紧贴硬件时钟、以微秒级精度对齐;越往外层,同步频率越低、批量越大。这正好补上了传统两条路线的短板:纯全局同步方案(如传统 MPI 全局栅障)在十万卡规模下协调开销随节点数暴涨;纯异步方案(如多数参数同步系统的宽松一致性)则调试困难、收敛行为难以复现。嵌套的思路是让同步发生在合适的层级:小团队内部紧密协同,大团队之间按节奏对齐,层层嵌套下去,百万级处理器才不至于互相踩脚。

第二板斧是统一内存寻址。传统分布式集群里,跨节点访问数据要靠显式通信原语——开发者要么走 RDMA 的 verb 接口手动管理远端内存注册与数据搬运,要么依赖消息传递层做序列化拷贝,数据“躺在别人的内存里”这个事实被原封不动地暴露给了程序员。Peerium 的做法是把全集群抽象成一张扁平的全局地址表:处理器可以用类似本地 load/store 的内存语义直接访问远端内存,跨卡访存经由 灵衢 总线直达对端的内存控制器,时延控制在微秒级、逼近本地访问量级(信源:华为发布会披露口径[1];作为参照,传统以太网 RDMA 跨节点时延通常在数十微秒以上[3])。这对生态建设是釜底抽薪式的改善——主流 AI 框架的分布式策略不必围绕“哪些数据在哪台机器上”重构,编程模型随之塌缩回接近单机的形态。

第三板斧是平等互联,它直接宣判了主从架构的出局:集群里没有天然的“老大”,每个计算单元都是对等参与者。

据多位长期跟踪华为计算产品线的人士观察,华为这两年在超节点方向上动作密集,此次把架构层概念直接推到台前,与其说是产品发布,不如说是在为整个计算体系“正名立规”——先立标准话语权,再谈商业收割。

🔌 灵衢:架构落地的那个“插座”

再好的架构思想,没有互联技术兜底,都只是论文里的漂亮章节。

Peerium 要落地,靠的是 灵衢。华为的介绍是:灵衢 基于一个开放协议,可无限扩展地联接 CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储与网络的平等互联。(信源:华为 灵衢(UnifiedBus)2.0 协议公开资料[4])

注意这里的两个关键词。一个是“开放协议”——华为没有把它做成私有接口,而是面向整个产业开放,联接对象横跨计算、存储、网络三大类设备。这意味着 灵衢 的野心不局限在自家超节点内部,而是希望成为AI集群层面的通用底座,就像过去几十年里那些定义了服务器互联形态的关键协议一样。

另一个关键词是“平等”。传统集群里,CPU是主角,NPU是外挂加速器,存储和网络是外围配件,主从关系体现在硬件拓扑的每一个角落。而 灵衢 把所有设备拉到同一张互联平面上,SSD和交换机的地位与CPU对等。当AI训练的瓶颈越来越频繁地从计算转向数据和网络时,这种对等设计就有了现实意义。

业内私下常说的一句话是:算力之争,上半场拼芯片,下半场拼互联。芯片决定单点上限,互联决定集群下限——而 Peerium 显然想把上下限一起重新画一遍。

📦 Atlas 950 打头阵:架构要靠产品说话

架构故事讲得再好,最终都要回答一个问题:客户的训练和推理任务跑得动吗?

Peerium 的首代产品是 Atlas 950 超节点。华为给出的进度相当具体:25.6万卡 Atlas 950 超节点集群已在部署中;基于 NPO 的 Atlas 960 系统正在测试中。(信源:华为全联接大会2025发布会[1])

这两个数字背后是清晰的节奏感。25.6万卡意味着 Peerium 不是实验室概念,而是已经进入实际部署阶段的大规模系统;而 Atlas 960 直接用上 NPO(网络处理单元与光互连的更近耦合方案),说明下一代产品在互联密度和能效上还要再上台阶。用产品路线图倒推架构演进,是 华为 一贯的打法。

徐直军在发布会上的表态也把定位说透了:“AI 时代,华为基于开创的 Peerium 计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。”(信源:华为全联接大会2025主题演讲实录[1])

对标 NVL144:数字不撒谎

架构是否“颠覆”,最终要落在可对比的量化指标上。按照 华为 发布会披露的口径,Atlas 950 超节点在几个硬指标上直接对标 NVIDIA 的 GB300 NVL144 系统:

指标**Atlas 950** 超节点NVIDIA GB300 NVL144倍数
单超节点卡数8,192 卡144 卡约 57 倍
互联带宽16 PB/s约 1.4 PB/s约 10 倍以上
跨卡访存时延微秒级(灵衢总线直达内存)亚微秒级(NVLink 域内)同一量级,域外差距拉大
可扩展上限50万卡以上超集群(Atlas 950 SuperCluster)依赖 InfiniBand 外部组网,单集群公开口径在10万卡级数倍以上

(信源:华为发布会披露数据[1];NVIDIA GB300 NVL144 官方规格[5];超大规模集群公开报道[6]。其中互联带宽倍数按双方公开口径折算,NVL144 侧以 NVIDIA 官方公布的 NVLink 域聚合带宽为准。)

这组数字里最值得盯的是互联带宽。超节点的本质是“把一个机柜变成一台计算机”,互联带宽就是这台“计算机”的总线宽度——16 PB/s 意味着每张卡可分到的带宽足以在训练中喂饱大规模张量并行与专家并行(MoE)的通信需求,而不必把计算图切成过细的流水线去迁就网络。而 50万卡级 SuperCluster 的公开规划,则直接回应了“百万级处理器”的架构承诺——对照行业内目前公开披露的十万卡级集群天花板,扩展规模的量级差异本身就是护城河。

值得一提的是,华为 AI 战略的核心是算力,坚持硬件变现——这是华为轮值董事长汪涛在此前的表述中明确过的立场(信源:华为公开采访与业绩发布会口径[7])。换句话说,Peerium 不是开源布道,而是有明确商业闭环的架构战略:用架构定义产品,用产品换取算力市场的份额,再用份额反哺生态。

⚔️ 真正的赌注:生态临界点

架构之争的终局,从来不只看技术,而看有多少人愿意跟着你重新学一遍。

Peerium 发布当天,徐直军还谈到了鸿蒙生态的临界点:突破 1 亿用户就如同核裂变的“临界质量”或者飞机起飞的“离地速度”(信源:华为全联接大会2025主题演讲[1])。这个比喻放在 Peerium 上同样成立——一项新架构能否存活,取决于能否跨过生态采用的临界点,跨过去了,指数级增长启动;跨不过去,再先进的设计也会变成孤岛。

灵衢选择开放协议,显然是奔着降低临界门槛去的:联接对象不限于自家设备,越多的CPU、NPU、存储和网络厂商接入,架构的引力场就越大。Nested BSP 是给开发者的编程范式,统一内存寻址是给软件栈的简化承诺,这些都是围绕“让别人愿意上车”设计的。

客观地看,前路并不轻松。冯·诺依曼体系积累了几十年的软件资产、开发者习惯和产业惯性,任何新架构都要在兼容成本与收益之间反复被检验。但另一个事实同样清晰:AI 算力需求持续增长,当单机架构与主从拓扑的红利接近尾声时,产业必须有人先迈出这一步。业界目前的一种共识是,超节点和大规模集群互联正是当下算力竞争的主战场,Peerium 的发布相当于把战场规则书的修订权摆上了台面。

小结

Peerium 的发布,本质上是 华为 对“AI时代的计算机应该长什么样”给出的一份答卷:用嵌套并行重排任务,用统一寻址抹平数据鸿沟,用 灵衢 让计算、存储、网络平等互联,再用 Atlas 950 和 Atlas 960 超节点把架构变成看得见的产品。

架构之争才刚开局。接下来值得盯的信号有三个:25.6万卡集群部署后的实际表现、灵衢开放协议能拉来多少合作伙伴、以及 Peerium 上的开发者生态能否像鸿蒙一样熬过临界点。真正的胜负,要等飞轮转起来才知道——而这个飞轮的转速,最终将由量化指标说了算:互联带宽的倍数、跨卡访存的时延、集群规模的天花板,以及每一个愿意在新架构上重写代码的开发者。

参考来源

[1] 华为全联接大会2025(HUAWEI CONNECT 2025),徐直军主题演讲及华为官方发布会材料,2025年9月17日,上海。

[2] L. G. Valiant, "A Bridging Model for Parallel Computation," Communications of the ACM, Vol. 33, No. 8, 1990。

[3] NVIDIA 及业界公开测试口径:以太网 RoCE/RDMA 跨节点访问时延通常在数十微秒量级,NVLink 域内访存时延为亚微秒量级。

[4] 华为 灵衢(UnifiedBus)2.0 开放协议技术白皮书及官网公开资料。

[5] NVIDIA GB300 NVL144 系统官方规格页(NVLink 域聚合带宽、卡数等参数)。

[6] 超大规模 AI 集群公开报道(含 xAI Colossus 等十万卡级集群建设进展的媒体报道)。

[7] 汪涛关于华为AI战略“坚持硬件变现”的公开表述,见华为历次业绩说明会及公开采访。

本文由本站 AI 辅助聚合生成,原始来源如下:

🔎 本文基于以下资讯(素材溯源 · 信息来源)

📰 相关阅读推荐(与本文相关的其他资讯)