冯·诺依曼,被华为翻篇了?
华为在上海发布Peerium计算架构,宣称以嵌套并行、统一内存寻址和平等互联,让百万级处理器协同成一台计算机。本文拆解其技术逻辑、灵衢互联的关键角色与Atlas 950/960的产品落地节奏,并判断这场架构叙事的成色与挑战。
1945年定下的规矩,80年后有人说要改。
9月17日,华为在上海发布了AI时代的全新计算架构Peerium,核心话术只有一句:让百万级处理器作为一台计算机协同工作。官方给的三个支点是嵌套并行、统一内存寻址和平等互联,落地的首代产品是Atlas 950超节点,25.6万卡的集群已在部署,基于NPO的Atlas 960系统正在测试中。
一句话判断:这不是一次常规的产品迭代,而是一次架构叙事的重写。它能不能成立,决定的不只是华为自己,还有整个国产算力体系的天花板。
🖥️ 先撞墙的,是冯·诺依曼
要理解华为在讲什么,得先回到那个几乎人人都会背的名词:冯·诺依曼架构。
运算器、控制器、存储器、输入与输出,各司其职,按程序顺序执行。这套80年前定下的体系,养活了从大型机到智能手机的整个现代计算产业。但它有一个刻在基因里的设定——主从关系。CPU是主,其他是从;一台机器是一个单元,机器与机器之间靠网络拼。
AI把这套设定的裂缝撕开了。
训练一个大模型,本质上是一个规模被推到极限的并行计算问题。单机再强,能塞进去的处理器、内存带宽都是有限的;用传统方式把成千上万台机器连起来,节点之间的通信开销、同步等待、故障恢复,每一项都在吞噬算力。业内流传一个说法:集群规模翻倍,有效算力未必翻倍,有时候反而在往下掉。
华为轮值董事长徐直军在发布会上给出了华为式的回应——他说,AI时代,华为基于开创的Peerium计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。
注意其中的产业判断:当单机性能提升的路被物理规律和工艺限制卡住,架构本身就成了新的性能来源。用系统设计换芯片制程,这是所有被先进制程卡脖子的玩家共同的选择,华为只是把它讲得最彻底。
🧩 三个关键词,重新组织一台'计算机'
Peerium的技术描述只有三个词,但每个词都在动传统架构的根。
第一个是嵌套并行。官方术语叫Nested BSP——嵌套批量同步并行,把并行计算任务像洋葱一样分层递归组织:小范围同步,大范围再同步。传统做法里,几千上万张卡要等所有人跑完才进下一步,卡越多等得越久;嵌套之后,各层各管各的同步边界,扩展性才撑得住百万级。
第二个是统一内存寻址。传统集群里,每台机器的内存是各自的孤岛,跨节点取数据要走完整的网络协议栈。统一寻址意味着在系统层面,百万级处理器的内存被当作一个整体来看待和调度——这在工程上难度极高,但在AI负载上收益极大,因为大模型训练最痛的就是数据搬运。
第三个是平等互联,也是最激进的一条:官方明确说这'颠覆了长久以来的主从架构'。计算、存储、网络,没有谁是老大,全是平等节点。
我们用一张图对比两种架构的组织方式:
据多位接近华为的产业人士的说法,这套架构在内部论证了相当长时间,难点从来不在纸面设计,而在软件栈能否吃下这种组织方式。架构发布只是上半场,编译器、调度器、并行框架能不能跟上,才是下半场。
🔗 真正的胜负手,是灵衢
如果说Peerium是剧本,那么灵衢就是舞台本身。
华为的表述很直白:灵衢基于一个开放协议,可无限扩展地联接CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储与网络的平等互联。翻译一下,这是一套底层互联协议——类似于把PCIe、以太网、专用互联总线的活儿,用一个协议统一掉。
为什么这件事比架构名词更重要?看一组对比就明白:
| 维度 | 传统集群方案 | Peerium+灵衢路线 |
|---|---|---|
| 互联方式 | 以太网/IB + PCIe 拼接 | 单一开放协议统一互联 |
| 互联对象 | 机器与机器 | CPU、NPU、内存、SSD、网卡、交换机平等接入 |
| 架构关系 | 主从、分层 | 平等互联、对等通信 |
| 扩展上限 | 单集群数千卡常见 | 官方宣称百万级处理器 |
| 软件范式 | 消息传递为主 | Nested BSP 嵌套批量同步并行 |
互联协议是典型的'赢者通吃'生意:协议本身不值钱,值钱的是围绕它的整机、芯片、软件生态。NVLink之所以成为英伟达护城河的一部分,不在于技术多神秘,而在于全世界的大模型都默认在它上面跑。
灵衢的潜台词也在这里——用开放协议吸引第三方接入,把'超节点'从华为一家的产品形态,变成一个可以被产业链共同参与的生态位。这和当年鸿蒙的操作思路一脉相承:先定义标准,再定义生态。
风险同样明显:协议生态需要时间发酵,开放协议到开放生态之间隔着无数适配、认证和商业博弈。灵衢能不能长出自己的'临界质量',参照徐直军谈鸿蒙时的那个比喻——突破1亿用户就如同核裂变的临界质量、飞机起飞的离地速度——互联协议同样需要这样一个起飞点。
📦 从Atlas 950到960:叙事要靠产品兑现
架构故事再漂亮,最终要落在可部署的机器上。
华为给出的路线图是这样的:
- 2026年9月 : Peerium架构与灵衢协议发布
- 当前 : Atlas 950超节点为架构首代产品
- 部署中 : 25.6万卡Atlas 950超节点集群
- 测试中 : 基于NPO的Atlas 960系统
几个值得咀嚼的细节。
第一,首代产品直接定在25.6万卡集群。 这不是概念机,是正在部署的工程实体。超节点的商业逻辑是:客户买的不是一堆服务器,而是'一台逻辑计算机'——运维更简单、线性度更好、单位有效算力成本更低。这对大规模训练和推理客户是实打实的采购理由。
第二,NPO进入测试。 NPO(近封装光学)意味着光引擎贴近芯片封装,互联带宽和能效再上一个台阶。960上NPO,等于给'平等互联'的管道再加粗——这对推理场景尤其关键,因为推理的流量特征比训练更碎片、更难伺候。
第三,与华为整体AI战略咬合。 华为轮值董事长汪涛此前明确表态:华为AI战略的核心是算力,坚持硬件变现。也就是说,Peerium不是学术发布,它背后是一条'架构定义—芯片—超节点—集群'的完整变现链路。结合华为用国产芯片和鸿蒙生态拿下国内出货份额第一的背景,算力侧的国产替代已经从'能用'走向'好用'的阶段,Peerium是这个阶段该有的动作。
⚖️ 克制地说:故事很好,考题很硬
把话说透之后,也要把问题说透。
架构叙事的第一个考题是软件。Nested BSP是一种新范式,意味着开发者要理解它、工具链要优化它、主流大模型框架要适配它。历史上多少新架构死在'硬件领先、软件掉队'上,不用赘述。
第二个考题是生态。灵衢是开放协议,但开放的成效取决于有多少第三方芯片、整机、存储厂商愿意接入。这考验的不是技术,是华为组织生态的耐心和让利能力。
第三个考题是时间。25.6万卡集群在部署、960在测试,这些都是进行时而非完成时。从'正在部署'到'规模化稳定运行',中间隔着散热、供电、故障率、良率一整片沼泽地。据产业侧的普遍看法,超节点类产品真正的口碑,要等第一批客户跑满一个训练周期之后才会形成。
但方向上,笔者的判断是明确的:在制程受限的现实约束下,用架构和互联换性能,是国产算力唯一也是正确的路径。 华为把这一选择上升为架构宣言,等于公开了自己的方法论——这既是自信,也是把身位亮给了对手和生态伙伴看。
结语
回到标题的问题:冯·诺依曼真的被翻篇了吗?
严谨地说,Peerium没有推翻冯·诺依曼的运算与存储分离,它推翻的是'单机为主、主从分明'的组织方式,把一台计算机的边界从机箱扩展到了百万级处理器。这是渐进式革命,但足够有分量。
接下来两年,值得盯三件事:灵衢协议能拉进多少第三方伙伴、Atlas 950集群的实际运行数据、以及960上NPO后的互联能效。架构战争的胜负,从来不在发布会,在机房。华为已经把桌子掀了——接下来看牌桌上还有谁跟。