华为把百万颗芯片拧成一台计算机
📋 总体概括
华为在上海发布Peerium计算架构,以嵌套并行、统一内存寻址和平等互联突破冯诺依曼主从架构,借灵衢互联协议让百万级处理器协同为一台计算机。Atlas 950超节点25.6万卡集群已在部署,这场架构级豪赌,赌的是AI算力范式的话语权。
📄 正文
9月17日,上海,华为把一场发布会的主题定在了80年前。
冯·诺依曼架构自1945年确立以来,第一次被一家中国公司在自家大会上公开点名「突破」。华为发布AI时代的全新计算架构Peerium,口径相当克制但分量极重:百万级处理器,作为一台计算机协同工作。
注意,不是「集群」,是「一台计算机」。这两个词之间的差距,就是这个架构的全部野心,也是本文要拆解的东西。
🏛️ 先回答一个问题:冯诺依曼架构怎么了
所有颠覆式叙事,都要先找到那堵墙。
先补一堂五十年代的课。冯·诺依曼体系结构的核心是:计算机按程序顺序执行,运算器、控制器、存储器、输入与输出各司其职。这套结构里天然存在一个「主」和「从」——控制器指挥一切,存储器和运算器是被动执行者。你手里每一台手机、笔记本、服务器,骨子里都是这套80年前的蓝图。
单机时代,这套主从架构效率极高。但AI把它逼到了墙角:大模型训练动辄需要数十万甚至上百万颗芯片协同,而传统架构下,芯片之间依旧是「主从关系」——一个调度者发号施令,其余是干活的。机器越多,调度开销越大,通信延迟越高,扩展性越差。业内把这个问题叫「扩展墙」:加卡容易,加效率难。
华为给出的答案是三件套:嵌套并行、统一内存寻址、平等互联。
其中最核心的理论创新是 Nested BSP——嵌套批量同步并行。这是一种把并行计算任务分层递归组织的计算范式:小到一个节点内部的几十颗芯片,大到百万卡集群,每一层都按「批量同步」的方式自洽运转,层与层之间再嵌套组织。官方表述是「突破了传统图灵范式与冯·诺依曼单机架构的限制」。
| 维度 | 冯·诺依曼单机架构 | Peerium 架构 |
|---|---|---|
| 组织方式 | 主从架构,控制器指挥 | 平等互联,无中心主从 |
| 执行范式 | 按程序顺序执行 | Nested BSP 嵌套批量同步并行 |
| 内存视角 | 单机统一寻址 | 跨百万处理器的统一内存寻址 |
| 扩展上限 | 单机即上限 | 百万级处理器强扩展 |
| 时代假设 | 一台机器解决一个问题 | 一个集群就是一台机器 |
说白了,华为在做的事情,是把「计算机」的定义从一台设备,改写为一个可以无限生长的系统。这不是参数竞争,是范式竞争。
🕸️ 灵衢:让CPU和SSD坐上同一张桌子
架构是理想,互联是现实。
再漂亮的架构范式,落不了地就是论文。让 Peerium 从白纸变成机器的关键,是华为的互联技术灵衢。
灵衢基于一个开放协议,可以联接 CPU、NPU、内存、SSD、网卡和交换机——关键词是「无限扩展」和「平等互联」。翻译一下:在灵衢体系里,一颗NPU和一块SSD在总线地位上是平等的,计算、存储、网络不再有谁隶属于谁的问题,全部挂在同一张可扩展的网上。
这件事为什么重要?看传统数据中心的痛处就懂了。GPU卡很贵,但大量时间不是在算,而是在等——等数据从远端存储搬过来,等网络把梯度同步完。互联效率,才是超大规模算力的第一瓶颈。这也是为什么英伟达这些年真正的护城河不是芯片本身,而是NVLink和NVSwitch。
灵衢的思路与之对位,但走的是开放协议路线——协议开放,意味着理论上第三方设备也能接入这张网。据产业链一侧的观察,这种「协议先行」的打法,历来是做大生态的标准动作:先把联接标准立住,再让上下游顺着标准长出来。
一种计算架构能否成立,最终不取决于发布会的PPT,而取决于有多少设备愿意说同一种「方言」。灵衢就是华为押下的那个方言。
📦 Atlas 950:25.6万卡,先干起来
架构叙事的下半场,只认出货。
Peerium的首代产品,是Atlas 950超节点。发布会给出的是一组正在时态:25.6万卡的Atlas 950超节点集群已经在部署中,基于NPO(近封装光学)的Atlas 960系统正在测试中。
「部署中」三个字值得多看一眼。25.6万卡是什么概念?这意味着管理的是超过25万颗处理器的供电、散热、互联和故障容错——每一颗都可能坏,坏一颗不能拖垮一台「计算机」。这正是 Nested BSP 和灵衢要解决的工程问题:分层递归的组织方式,让故障被隔离在层内,不至于扩散成全局灾难。
从Atlas 950到Atlas 960的迭代路径也能看出节奏:950用成熟的电互联方案先把规模做上去,960引入NPO近封装光学,把互联带宽和能耗比再推一层。光学进封装,是超节点竞赛里公认的下一站,谁先规模化谁就掌握下一代集群的定义权。
华为轮值董事长徐直军在发布会上的表述是:「AI时代,华为基于开创的 Peerium 计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。」
去掉修辞,这句话的实质是:训练和推理双场景通吃,硬件直接变现。这与此前华为轮值董事长汪涛「AI战略的核心是算力,坚持硬件变现」的表态一脉相承——不靠故事盈利,靠卖机器赚钱。
🧭 范式之争:赌的是下一个四十年的定义权
架构之战,从来不只是技术之战。
把镜头拉远,看这场发布的产业位置。
过去十年,AI算力的体系结构话语权基本掌握在一条路径上:以专有互联绑定自家芯片,形成「芯片—互联—框架—集群」的垂直闭环。后来者要么加入闭环,要么自建一套。华为选的是后者,而且选得比「自建一套芯片」激进得多——直接改写了「什么是一台计算机」。
这条垂直链条里,最底层的灵衢协议是根基,中间的超节点是产品,上层的百万卡集群是终局形态。产业逻辑上有两点值得注意:
其一,架构范式一旦被客户验证,切换成本极高。数据中心一旦围绕Peerium建起来,后续扩容几乎必然延续同一架构——这是比单次销售更深的锁定。
其二,开放协议是双刃剑。开放意味着生态可以长大,也意味着标准之争会来得更早。互联协议层面的竞争,未来两三年会成为算力产业真正的主战场。业内私下流传的判断是:超节点的比拼今年看卡数,明年看互联,后年看的是谁的协议成为事实标准。
再看华为手里的牌:自研芯片、鸿蒙生态、国内出货份额第一的基本盘,加上这次刻意强调的「开放」的灵衢。软件生态有鸿蒙讲临界点的故事——徐直军在同一场合把突破1亿用户比作核裂变的「临界质量」、飞机起飞的「离地速度」;硬件生态,Peerium加灵衢试图讲的是同一个故事:熬过临界点之前,全是投入;熬过之后,指数起飞。
风险也摆在明面上。Nested BSP需要上层软件栈的全面配合,百万级处理器的编程模型对开发者是全新课题;25.6万卡的部署效率、故障率和实际利用率,都要等真实负载来检验。架构创新的坟场里,埋的从来不是坏想法,而是没能跑通软件栈的好想法。
结语
每一代算力革命,都始于有人重新定义「计算机」。
Peerium的真正价值,不在于25.6万卡这个数字,而在于华为把竞争从「造更好的芯片」拉到了「定义机器的形态」。冯·诺依曼架构统治了80年,不是因为没人想过替代方案,而是因为主从结构的简单性太契合过去的硬件条件——直到AI把规模推到百万级。
接下来两年,看三件事就够了:Atlas 950集群的真实部署与利用率、灵衢开放协议能否吸引第三方设备入网、Nested BSP软件栈的开发者迁移成本。三者任何一项跑通,这场架构豪赌就赢下一城。
算力战争的上半场拼制程,下半场拼架构。发令枪,已经响了。
本文由本站 AI 辅助聚合生成,原始来源如下: