华为,要让冯诺依曼下岗?
华为在上海发布Peerium计算架构,以嵌套并行、统一内存寻址和平等互联三大机制,试图突破冯诺依曼单机架构与主从关系的限制,让百万级处理器协同为一台计算机。灵衢开放互联与Atlas 950超节点是这套叙事的落地抓手,本文拆解其技术逻辑与产业赌注。
9月17日,华为在上海把一个不像发布会热词的词推上主舞台——Peerium计算架构。官方口径很直白:让百万级处理器作为一台计算机协同工作。翻译一下,华为想改写的,是统治计算产业大半个世纪的冯·诺依曼单机叙事。
这事听着宏大,落到地上就是三件东西:灵衢互联、Atlas 950超节点、Nested BSP并行范式。本文拆一拆:华为到底动了谁的奶酪,这步棋又赌在哪。
🧠 冯诺依曼这堵墙,AI先撞上了
每一个做过大模型训练的团队,都体会过那种等待:几千张卡在一起,大部分时间不是在算,而是在等——等数据、等同步、等别的卡先算完。
问题出在哪?华为在发布会上给出了一份教科书式的诊断:冯·诺依曼体系结构要求计算机按程序顺序执行,运算器、控制器、存储器、输入与输出系统各司其职,而主从关系贯穿其中。
这套架构是1950年代定下的规矩:一个中央大脑发号施令,其余部件听命执行。单机时代,它是效率的代名词;但在AI时代,当算力需求以肉眼可见的速度膨胀,单机的天花板就变成了整个行业的天花板。
华为轮值董事长徐直军在发布会上说得很直白:“AI 时代,华为基于开创的 Peerium 计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。”
判断很清晰:超节点已经是行业共同的方向,大家都在把更多卡捆得更紧。但大多数厂商的思路仍是“集群思维”——把一台台独立的机器用网络连起来;而华为这次想说的是“单机思维”——百万级处理器,本来就是一台计算机。前者是拼装,后者是重构。这就是架构叙事与产品叙事的分野。
🧩 Peerium的三板斧,斧斧砍向旧秩序
架构重构听起来玄,拆开看其实就三招,每一招都对准了冯·诺依曼的一条老规矩。
第一招,嵌套并行。Peerium提出Nested BSP(嵌套批量同步并行),把并行计算任务分层递归组织——小到一组处理器内部同步,大到全集群级同步,一层套一层。这直接绕开了传统图灵范式与冯·诺依曼单机架构对“顺序执行”的依赖。
第二招,统一内存寻址。过去“存算分离”,数据要在存储器和运算器之间反复搬运;统一寻址之后,百万级处理器看到的可以是同一片内存空间,搬数据的开销被架构性地压低。
第三招,平等互联。这是对“主从关系”最釜底抽薪的一击——处理器之间不再分主次,互联对等,扩展才有强弹性。
| 维度 | 冯·诺依曼单机架构 | **Peerium**架构 |
|---|---|---|
| 组织关系 | 主从关系贯穿其中 | 平等互联 |
| 执行方式 | 按程序顺序执行 | Nested BSP嵌套批量同步并行 |
| 资源视图 | 运算器控制器存储器各司其职 | 统一内存寻址 |
| 扩展上限 | 单机为主 | 百万级处理器强扩展 |
一句话总结:三招合起来,是把“一台计算机”的定义,从一间机房缩小到一个机柜,再放大到一座数据中心——但逻辑上,它始终是“一台”。
🔌 灵衢:这张开放协议的牌,很关键
架构是蓝图,互联是地基。地基的名字叫灵衢。
按华为的介绍,灵衢基于一个开放协议,可以“无限扩展地”联接CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储与网络的平等互联。
注意这里的关键词不是“联接”,而是“开放”。历史上,计算产业里真正改变格局的互联技术,几乎都押在了开放性上:开放,意味着第三方可以进来,意味着CPU、NPU、存储厂商可以在同一个协议下共处,意味着Peerium不只是一华为自家的架构,而可能成为一个生态的入场券。
对产业链来说,这是一个明确的信号:CPU、NPU、SSD、网卡、交换机这些原本各做各的品类,未来可能要围绕同一套互联协议重新设计产品。有接触过相关方案的产业链人士提到一个共识——这类架构能不能走远,互联的开放程度是决定性变量,协议越开放,愿意跟着做兼容的伙伴越多,Peerium的“百万级”才不是一华为自己的数字。
反过来说,如果开放只停留在纸面,灵衢就会退化成一条自用总线,Peerium也就回归成一个超节点产品,而不是一次架构革命。这张牌怎么打,值得盯紧。
📦 Atlas 950上桌:架构叙事开始见货
架构发布最容易被人质疑的一点是:图好看,货呢?
华为这次把答案提前摆了出来。Atlas 950超节点是Peerium计算架构的首代产品,而且不是PPT状态——25.6万卡的Atlas 950超节点集群已经在部署中;基于NPO(光电共封装)的Atlas 960系统正在测试中。
这里有两层信息值得展开。
第一层是规模。25.6万卡不是一个小数字,它意味着Peerium的“百万级处理器协同”不是终点愿景,而是可以按代际累加的路线图——首代25.6万卡,下一代更大。对客户而言,训练超大模型时的选择不再只有“堆散卡”,而是“租一台超大计算机”。
第二层是NPO。Atlas 960基于NPO,把光引擎贴近交换芯片,本质上是给互联减负——处理器越多,互联的功耗和时延压力越大,光电共封装是业界公认的续命手段。首代用成熟方案保部署,下一代用NPO提性能,节奏是典型的工程化打法:先上桌,再升级。
对采购方来说,这个节奏传递的信号是:Peerium不是期货,是正在交付的产品线。这对当下训练和推理两头吃紧的算力市场,是有现实意义的。
⚠️ 剩下的考题:生态与兑现
架构叙事讲得再漂亮,最后都要回答两个问题:生态跟不跟,工程稳不稳。
生态这一侧,华为手里并非空牌。同一场活动里,徐直军还谈到鸿蒙生态的临界点——突破1亿用户,就如同核裂变的“临界质量”、飞机起飞的“离地速度”。这套比喻背后,是华为对生态方法论已经非常熟练:先做产品,再攒伙伴,等过临界点。Peerium和灵衢大概率会复制这条路径。要知道,华为已经用国产芯片和鸿蒙生态拿到了国内手机市场出货份额第一,这场硬仗的打法是被验证过的。
商业这一侧,华为轮值董事长汪涛的表态同样清晰:AI战略的核心是算力,坚持硬件变现。这句话值得细品——Peerium不是技术秀,而是要变成超节点、集群、硬件订单的。对产业链来说,CPU、NPU、SSD、交换机这些环节,都可能因为一套开放互联协议被重新分工。
📌 但挑战也同样具体:Nested BSP的编程范式,开发者要重新学;统一内存寻址,编译器和调度器要跟上;百万级处理器的故障率管理,是对可靠性工程的极限考验。架构革命从来不是发布日完成的,是在接下来每一次系统升级、每一个客户训练任务里完成的。多位接触过超节点交付的人士的共同感受是:规模越大,运维的权重越高——这恰恰是超出发布会范畴的部分。
结语
冯·诺依曼没有做错什么,它只是老了。华为发布Peerium,本质是在算力焦虑的时代窗口里,把“超节点”从产品词升级成了架构词——嵌套并行、统一寻址、平等互联三板斧,配上一条开放协议的灵衢,再用25.6万卡部署中的Atlas 950证明自己不是期货。
真正的看点在后头:灵衢的开放能换来多少伙伴,Atlas 960的NPO能兑现多少性能,Nested BSP能否长出自己的开发者生态。如果这三件事成了,计算产业讲了几十年的“单机叙事”,可能真的要换剧本了。盯住灵衢的生态名单,比盯住任何一场发布会都管用。