冯诺依曼,被华为翻篇了?
华为发布Peerium计算架构,试图突破冯诺依曼单机架构与主从模式,以Nested BSP嵌套并行和灵衢互联实现百万级处理器协同。本文拆解其技术逻辑、产品节奏与产业胜负手。
冯诺依曼,被华为翻篇了?
2025年9月17日,上海。华为轮值董事长徐直军站在台上,说了一句信息量远超发布会热度的话:AI时代,华为基于开创的 Peerium 计算架构,让算力无处不在。
抛开话术,这句话的实质是:华为不再满足于在现有计算体系里做跟随者和优化者,而是试图对支撑了计算机行业近八十年的冯·诺依曼架构动刀。百万级处理器作为一台计算机协同工作——这不是超算圈的老话题堆叠,而是一次对底层范式的公开叫板。
本文想回答三个问题:Peerium 到底改了什么?为什么 灵衢 互联才是真正的底牌?以及,这套架构的商业化时间表靠不靠谱。
📉 先看清背景:算力需求撞上了架构天花板
场景先摆出来。过去两年,AI 大模型训练规模一路上探,集群规模从千卡到万卡再到十万卡。但行业的共同体感是:堆卡越来越贵,效率越来越低。一个十万卡集群里,真正用于有效计算的时间占比,被通信等待、同步开销、故障恢复一点点吃掉。
问题的根子在哪?华为给出的诊断是架构层面的。冯·诺依曼体系结构要求计算机按程序顺序执行,运算器、控制器、存储器、输入输出各司其职,而主从关系贯穿其中——一个大脑指挥全身。这套范式在单机时代无往不利,但放到百万级处理器规模,主从架构就成了天然瓶颈:你不可能让一个「主」去管一百万个「从」。
华为的判断写在 Peerium 的三个技术支点里:嵌套并行、统一内存寻址、平等互联。组合起来,指向百万级处理器的强扩展能力。
用一张图看清楚这套架构的层级关系:
产业逻辑并不复杂:当算力竞赛从「单芯片性能」转向「集群规模效率」,谁先解决规模化协同的架构问题,谁就掌握下一代数据中心的定义权。华为不是唯一看到这一点的人,但是少数把话说到「突破图灵范式与冯·诺依曼单机架构」这个级别的玩家。
🧠 Nested BSP:把「分层递归」塞进并行计算
每节一句金句开场:并行计算的老问题,从来不是算不动,而是等不起。
Peerium 架构的核心计算范式叫 Nested BSP——嵌套批量同步并行。要理解它,得先回看计算机科学的一堂老课。
传统图灵范式与冯·诺依曼架构,本质上是「顺序执行」的世界观:程序一步一步跑,主控单元调度一切。BSP(批量同步并行)本身是并行计算的经典模型——计算、通信、同步三段循环。而华为做的是把这个模型「嵌套化」:任务分层递归组织,一个大规模并行任务内部再嵌套子任务,每一层独立完成批量同步。
这样做的价值在于:全局同步被拆解成了局部同步。百万级处理器不需要在每一个计算步调后集体等待,而是按层级、按子集各自完成同步,等待时间被结构性压缩。
我们用一张表对比两套范式的差异:
| 维度 | 冯·诺依曼单机架构 | Peerium 架构 |
|---|---|---|
| 组织关系 | 主从架构,主控调度 | 平等互联,无中心主从 |
| 执行方式 | 按程序顺序执行 | Nested BSP 嵌套并行 |
| 内存视角 | 存储与运算分离 | 统一内存寻址 |
| 扩展规模 | 单机为边界 | 百万级处理器强扩展 |
| 互联对象 | 总线连接各部件 | 计算、存储、网络平等互联 |
需要泼一盆冷水的是:范式 announced 和范式跑通是两回事。Nested BSP 的工程难点在于编译器、调度器和上层框架的整套配套——华为发布会上没有展开软件栈细节,这部分要在 Atlas 950 集群实际部署后才能验证。据多位接近人士透露,业内的普遍态度是「方向认可,数据等看」,这也是对新架构应有的冷静。
🔗 灵衢:藏在架构名字背后的大招
如果说 Nested BSP 是方法论,那 灵衢 就是方法论落地的路。
华为在发布会上明确说:灵衢是实现 Peerium 架构的关键互联技术,基于一个开放协议,可以「无限扩展」地联接 CPU、NPU、内存、SSD、网卡和交换机——注意这个表述,计算、存储与网络的平等互联。
这句话的分量,圈里人一听就懂。传统数据中心里,计算走计算的总线,存储走存储的协议,网络走网络的交换,三张网络、三套协议、三个团队各管一段。而灵衢要把它们拉到同一个协议平面上。这意味着内存可以像被 CPU 访问一样被 NPU 访问,SSD 和网卡在寻址视角下与处理器平权——这正是「统一内存寻址」的物理基础。
这里有一个容易被忽略的战略细节:灵衢是开放协议。对照行业现状,高端 AI 集群互联长期由少数私有方案主导,协议封闭意味着生态绑定。华为选择开放,明面上是技术自信,实际是生态卡位——给产业链上下游留出入口,让交换芯片、网卡、整机厂商都能上车。
产业逻辑上,互联协议之争从来不只是技术之争,是标准之争。谁的定义被更多人采纳,谁的生态半径就大。灵衢能否成为事实标准,取决于它在华为体系外的渗透速度——这是比发布会本身更值得跟踪的变量。
🚀 Atlas 950 与 960:从论文到机柜的时间表
范式要落地,最终看产品。华为这次给了两个明确的锚点:Atlas 950 超节点是 Peerium 计算架构的首代产品;基于 NPO(光电共封装)的 Atlas 960 系统正在测试中。更关键的是一个规模数字:25.6 万卡 Atlas 950 超节点集群已在部署中。
25.6 万卡是什么概念?即便按当前主流超节点定义,这已经逼近「百万级处理器」愿景的第一座里程碑。梳理一下节奏:
Peerium架构发布
Atlas 950超节点为首代产品
25.6万卡Atlas 950集群
基于NPO的Atlas 960系统
两个技术信号值得单独拆开看:
- 首代即大规模部署。新架构跳过小规模试点、直接上 25.6 万卡集群,说明华为对 Nested BSP 和灵衢的工程成熟度有一定底气,也说明国内算力需求确实等不及渐进验证。
- Atlas 960 转向 NPO。光电共封装是把光引擎与交换/计算芯片封装在一起,缩短电信号距离、降低互联功耗。下一代产品绑定 NPO,说明华为把「无限扩展互联」的下一个瓶颈锁定在功耗与信号完整性上——这是行家的选择。
| 产品 | 状态 | 关键特征 |
|---|---|---|
| Atlas 950 超节点 | 首代产品,25.6 万卡集群部署中 | Peerium 架构首发载体 |
| Atlas 960 系统 | 测试中 | 基于 NPO 光电共封装 |
产业逻辑层面,这套产品节奏背后还有一个现实背景:徐直军 在同一场合多次强调,华为 用国产芯片与鸿蒙生态拿下了国内出货份额第一,华为 AI 战略的核心是算力、坚持硬件变现。换句话说,Peerium 不是学术发布会,而是华为算力商业闭环的底层投资——架构、互联、整机、集群,一条链吃下来。
⚠️ 冷静一面:范式革命的三道坎
每节一句金句开场:宣布突破只需要一场发布会,证明突破需要三到五年。
第一道坎是软件生态。Nested BSP 需要编译器、算子库、分布式框架的全链路适配,主流 AI 框架的迁移成本是客户决策时的第一道心理关。第二道坎是多样性负载。训练大模型是 Peerium 的主场,但真实数据中心里还有推理、数据库、HPC 等长尾负载,统一内存寻址能否通吃,有待观察。第三道坎是开放协议的生态速度——灵衢如果在华为体系外无人跟进,「开放」就只是姿态。
不过也要承认,判断标准本身在变。当单机架构的扩展性红利见顶,行业对「什么算一台计算机」的定义正在松动。华为把百万级处理器协同作为新原点,无论最终成败,都把问题摆上了台面:算力竞争的下一段,拼的是架构,不再是单纯堆卡。
小结
Peerium 的真正价值,不在某个单点参数,而在于华为把竞争维度从芯片拉回了架构:Nested BSP 解决并行组织,统一内存寻址解决资源平权,灵衢解决物理互联,Atlas 950/960 解决商业化落地。25.6 万卡集群的部署进度,是接下来验证这套叙事的硬指标。若软件生态与开放协议两条线能跑通,计算行业的「一台计算机」定义将被改写;若跑不通,它也是国产算力体系一次必要的架构演习。方向已亮牌,剩下的交给时间。