🏢 公司C档 · NaN分

百万芯片一台机,华为动了冯诺依曼

··约1分钟阅读

📋 总体概括

9月17日华为在上海发布Peerium计算架构,宣称让百万级处理器协同为一台计算机。本文拆解其嵌套并行、统一内存寻址、平等互联三大支柱,分析灵衢开放协议与Atlas 950/960超节点的落地节奏,并推演这套架构的生态胜算与三道坎。

📄 正文

9月17日,上海。华为把一场发布会的绝对主角,给了一个大多数人第一眼念不顺的词:Peerium。官方口径朴素到近乎狂妄——让百万级处理器作为一台计算机协同工作。这不是给单台服务器换壳,而是在重新回答一个八十岁的问题:什么叫做"一台计算机"。

我们的核心判断是:当制程逼近物理极限、单机架构的红利见顶,算力竞争的主叙事正在从"造更强的芯片"切换到"定义更大的机器"。Peerium 是这个切换的信号弹,而真正值得盯的,是它背后的互联协议和产品落地节奏。

🧱 八十岁的冯诺依曼,先撞墙的不是芯片

单机时代的标准答案,正在变成集群时代的核心问题。

过去我们说"一台计算机",指的是桌上那台、机房里那台:运算器、控制器、存储器、输入输出各司其职,程序顺序执行,主从关系贯穿始终。这就是 冯·诺依曼 体系结构,从上世纪四十年代确立至今,几乎定义了整个信息产业。

大模型改变了这一切。训练一个前沿模型,动辄需要成千上万张卡协同工作几个月,"计算机"的事实边界早已冲出单机。问题在于,底层架构还停留在单机逻辑:主从式的调度、顺序执行的假设、围绕单机设计的内存体系,放到十万卡、百万卡的规模上,通信和协调本身就开始吞噬算力。

华为给出的答案是 Peerium 的三大支柱:嵌套并行、统一内存寻址、平等互联,以此实现百万级处理器的强扩展能力。配套的计算范式叫 Nested BSP——嵌套批量同步并行,把并行计算任务分层递归组织,官方称其突破了传统图灵范式与冯·诺依曼单机架构的限制。

徐直军在发布现场的原话是:"AI 时代,华为基于开创的 Peerium 计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。"

产业逻辑很清晰:摩尔定律放缓之后,堆单芯片性能的边际收益越来越低,架构层面的翻新成了少数还能打开数量级空间的路径。华为这次不是在冯·诺依曼的框架里做优化,而是直接动它的地基。

🔗 灵衢,才是这场发布真正的底牌

算力的上限,从来不在芯片里,而在芯片之间。

Peerium 三大支柱里,前两条偏理论范式,第三条"平等互联"是实打实的工程底座,而承载它的,是实现该架构的关键互联技术:灵衢。

按华为的介绍,灵衢基于一个开放协议,可以联接 CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储与网络的平等互联,并且"无限扩展"。注意这几个措辞:开放、平等、无限。

传统服务器架构里,内存挂在 CPU 之下、存储挂在主板之上、网络挂在机箱之外——全是主从关系的延伸。灵衢做的事是把它们拉平:计算、存储、网络从从属关系变成对等节点。这正是"颠覆主从架构"在硬件层面的具体落点。

业界私下流传的一种说法是:超节点的竞争,本质上是互联的竞争。芯片参数可以靠堆料追赶,互联协议是系统工程,堆不出来。从芯片到超节点再到大规模集群,互联是那根决定天花板高度的承重梁。

而"开放协议"四个字,暴露了华为真正的野心:它想要的不是一条私有总线,而是类似以太网、PCIe 那样的生态位——让别人也能往里接设备,让灵衢成为集群世界的基础设施。

从上游芯片、互联协议,到中游超节点,再到下游集群客户,这条链路里灵衢是唯一的串联件。开放是生态野心,也是生态赌注——这条我们放在最后细说。

🚀 Atlas 950:架构必须先变成机器

架构讲得再漂亮,落不了地就只是 PPT。

Peerium 的首代产品是 Atlas 950超节点。华为公布的进展信息量不小:25.6 万卡的 Atlas 950 超节点集群已经在部署中,而基于 NPO 的 Atlas 960 系统正在测试中。

产品定位进展
Atlas 950 超节点Peerium 架构首代产品25.6 万卡集群部署中
Atlas 960 系统基于 NPO 的下一代系统正在测试中

从发布到部署的时间线大致是这样:

  • 9 月 17 日:上海发布 Peerium 计算架构
  • 同日:宣布 Atlas 950超节点 为首代产品
  • 当前:25.6 万卡 Atlas 950 超节点集群部署中
  • 进行中:基于 NPO 的 Atlas 960 系统测试中

25.6 万卡是什么概念?这已经不是一个机房里几排机柜的量级,而是接近一座数据中心规模的单体集群。把二十五万多个计算单元组织成"一台机器",考验的正是灵衢互联和统一内存寻址的工程成色。

NPO(近封装光学)则是通往 Atlas 960 的关键一步:把光模块尽可能贴近芯片封装,缩短电信号传输距离、压低互联功耗。规模越大,互联的能耗占比越高,光学互联是超节点继续膨胀的必经之路。

从产品节奏看路径很清楚:先用现有互联把规模做上去(950),再用光学互联把能效做下来(960)。这也与华为的商业模式一脉相承——华为轮值董事长汪涛此前明确表态,华为 AI 战略的核心是算力,坚持硬件变现。架构、协议、超节点、集群,最终都要变成可交付、可计费的硬件系统。

📐 Nested BSP:被忽视的那一半胜负手

硬件解决能不能,软件决定值不值。

Nested BSP 这个词在发布会的热度里被淹没了,但它可能是 Peerium 成败的另一半。传统 BSP 模型把并行计算分成若干个同步执行的批次,牺牲一些灵活性换取可预测性;Nested BSP 则把这种组织方式嵌套展开——大集群套子集群、子集群再套更小的执行单元,层层递归,每一层都有自己的同步边界。

这套范式的价值在于:百万卡的"一台机器",不可能靠一个全局锁协调所有处理器,必须分层治理。Nested BSP 等于给百万级并行提供了一套组织学。

但架构翻新真正的成本在软件栈。算子要迁移,框架要适配,开发者的心智模型要重建。业内普遍的看法是:开放协议解决"接得进来",编程范式决定"用得起来"。如果 Nested BSP 只停留在华为自家工具链内部,那 Peerium 就是一个性能更好的封闭集群;如果它能把外部开发者、外部框架吸引进来,那才是一次架构革命。

这恰恰是最难的部分。历史上每一次计算范式迁移,硬件先行、软件滞后十年是常态。华为把范式创新和硬件产品同时端上桌,节奏激进,风险也藏在这里。

⚖️ 开放是双刃剑,但华为没得选

单机可以自成一体,集群必须广结盟友。

对 Peerium 的推演,绕不开三道坎:

第一道,生态兼容。 全球存量 AI 软件栈围绕既有主流生态构建,迁移成本是客户决策里最重的一块砝码。Peerium 要进入主流视野,兼容能力和迁移工具是入场券。徐直军在同一场合谈 鸿蒙 生态时用过"临界质量"的比喻——突破 1 亿用户,就像核裂变的临界质量、飞机起飞的离地速度。这套物理隐喻同样适用于计算生态:临界点之前靠投入硬推,临界点之后自增强。

第二道,产业节奏。 从架构发布到规模商用,隔着部署、调优、验证三道工序。25.6 万卡集群的实际部署进展和运行表现,会是检验 Peerium 成色最诚实的试金石——Atlas 960 的测试结果则是下一个观察窗口。

第三道,开放的双面性。 开放会带来伙伴,也会稀释主导权。灵衢如果只接华为自家设备,它是一个产品;如果有大量第三方 CPU、NPU、存储设备接入,它才是一个标准。前者上限是华为一家的算力业务,后者上限是下一代数据中心的事实规范。华为选了难的那条路,但结合它一贯的打法——用开放协议换生态位,用硬件变现养长期投入——这条路其实没有别的选项。

回头看,Peerium 不是一次发布会式的造词运动。它是一次把"计算机"定义权往上抽一层架构的尝试:冯·诺依曼定义了单机,Peerium 想定义集群。硬件侧,25.6 万卡的 Atlas 950 集群已进入部署,基于 NPO 的 Atlas 960 在测试;软件侧,Nested BSP 才刚起跑。

未来十二个月,值得盯三个信号:Atlas 960 的测试进展、灵衢开放协议的第三方接入数量、Nested BSP 工具链的成熟度。三个都亮绿灯,"百万卡一台机"就不再是一句口号;差任何一个,它仍是一部野心勃勃的架构宣言。算力竞争的下半场,赌注刚刚放下。

本文由本站 AI 辅助聚合生成,原始来源如下:

🔎 本文基于以下资讯(素材溯源 · 信息来源)

📰 相关阅读推荐(与本文相关的其他资讯)