苹果把四颗芯片,焊成了一颗
M5 Ultra 首次用 UltraFusion 把两颗双芯片 M5 Max 焊成四芯架构,80 核 GPU 每核配神经网络加速器,1.2TB/s 带宽加 512GB 统一内存,让 Mac Studio 从剪辑机变成桌面上的 AI 工作站。本文拆解参数背后的产业逻辑:带宽才是本地大模型时代的硬通货。
8月25日,没有发布会,没有 Keynote,苹果把史上最强的 M5 Ultra 塞进了新款 Mac Studio,顺手还更新了 Mac Mini。对习惯了『one more thing』的果粉来说,这种『悄悄上桌』本身就是一种信号:这颗芯片的野心,已经不需要用聚光灯来证明了。
一句话概括这次升级——苹果把四颗芯片焊成了一颗,然后把 Mac Studio 从『剪辑机器』重新定义成了『桌面 AI 工作站』。
📈 一颗芯片的『合体术』
先讲一个老生常谈的场景:过去两年,专业用户买 Mac Studio 时最纠结的问题不是贵,而是『天花板』。M3 Ultra 已经是 苹果 能拿出来的极限,但当你在设备上跑一个上百 GB 的前沿大模型时,依然会听到内存带宽发出的『喘息声』。
M5 Ultra 给出的答案相当激进。据 IT之家 消息,这是 苹果 首次在 M 系列 SoC 中采用新一代 UltraFusion 技术构建四芯片架构:先把两颗 M5 Max 各自做成双芯片,再用 UltraFusion 把它们连接起来,组成一颗四芯片芯片组。芯片间带宽超过 4.4 TB/s,连接密度提升超过 6 倍,四个 die 协同工作时,在系统眼里依然是一颗统一的处理器。
这个架构选择背后有一条清晰的产业逻辑。摩尔定律放缓之后,单 die 堆核心的边际成本越来越高,先进封装与片间互连成了新的性能主战场——AMD 在 GPU 上玩 chiplet,英伟达靠 NVLink 缝多卡,而 苹果 的路线是把『缝合』做进封装里,对操作系统和应用完全透明。M3 Ultra 跳过 M4、直接把『两两成双』的合体术用到 M5 上,说明 苹果 已经认定:桌面级 AI 算力竞争,拼的不再是一颗 die 的极限,而是封装层面的集成度。
🔢 参数细看:钱该花在哪一栏
金句先行:在本地大模型时代,带宽才是硬通货,核心数只是门面。
我们把 M5 Ultra 和上一代旗舰的关键参数摊开看:
| 维度 | M3 Ultra | M5 Ultra | 变化 |
|---|---|---|---|
| 架构 | 双芯片 UltraFusion | 四芯片 UltraFusion | 首次四芯合体 |
| CPU 核心数 | 最高 32 核 | 最高 36 核(12 超级核+24 性能核) | 多线程至多 1.3 倍 |
| 单线程性能 | 基准 | 至多 1.25 倍 | 架构红利 |
| GPU 核心数 | 最高 76 核 | 最高 80 核 | 每核集成神经网络加速器 |
| 图形性能 | 基准 | 至多 40% 提升 | 第三代光追+网格着色 |
| AI 峰值 GPU 算力 | 基准 | 至多 4.5 倍 | 较 M1 Ultra 超 6 倍 |
| 统一内存带宽 | 约 0.8 TB/s | 1.2 TB/s | +50% |
| 统一内存容量 | 最高 192GB(大杯) | 最高 512GB | 本地跑大模型的关键 |
| 神经引擎 | 16 核 | 32 核 | 翻倍 |
单看 CPU,单线程 1.25 倍、多线程 1.3 倍,这是一次『稳健』的迭代;但内存带宽直接拉到 1.2 TB/s、比 M3 Ultra 高出 50%,配合最高 512GB 的统一内存,性质就变了。大模型本地推理的第一瓶颈从来不是算力,而是『把几百 GB 的权重从内存搬到计算单元的速度』。1.2 TB/s 加 512GB,意味着设备端跑计算密集型前沿 AI 模型,第一次在参数表上是『够格』的,而不只是『勉强能跑』。
这段时间业界私下讨论最多的一句话是:桌面端本地推理的窗口期,可能就是被这样一颗芯片打开的。
🤖 80 核 GPU,每核揣着一个 NPU
场景先行:过去你要在台式机上跑一个大参数量的开源模型,标准答案是『攒一台多卡工作站,插上两张高端独显』。而现在,苹果 给出的替代方案是一台巴掌大的铝盒子。
M5 Ultra 的 GPU 部分是这次最值得盯着的升级:80 个核心,每一个核心都集成了神经网络加速器。这意味着 GPU 的 AI 峰值算力相较 M3 Ultra 提升至多 4.5 倍,较 M1 Ultra 更是超过 6 倍。再叠加一颗翻倍到 32 核的神经引擎,官方的定位写得很直白——在设备上安全运行计算密集型前沿 AI 模型。
这背后是 苹果 一以贯之的推理逻辑:AI 不上云,就在端上。当友商还在卷云端算力租赁时,苹果 把宝押在了『隐私+低延迟+零订阅费』的本地推理体验上。每核一个神经网络加速器的设计尤其值得玩味——它让 AI 算力像着色器一样可以按负载灵活调度,图形渲染和模型推理共享同一块硅片,而不是各占一块die。对开发者来说,Metal 体系下写一次代码,图形与 AI 负载可以更细粒度地分配,这是英伟达 CUDA 生态之外一条完全不同的路。
当然,产业逻辑的另一面也要说清楚:本地推理的上限受制于内存容量和带宽,512GB 是海量,但对比动辄多卡集群的云侧方案,它瞄准的是『个人与小团队的前沿模型实验』,而不是企业级的规模化训练。Mac Studio 抢的是工作站和入门级 AI 服务器的市场,不是数据中心的饭碗。
🎬 创作者的账本:老本行也没落下
先看一个真实的工作流场景:一位剪辑师打开一条 8K 时间线,四路 ProRes 素材实时回放、调色、加特效,导出时再压一版 H.265 交付——这条流水线过去需要 M 系列外加外置扩展才能勉强流畅,现在被一颗芯片打包带走。
M5 Ultra 的媒体引擎全面加码:四路 ProRes 编解码引擎,硬件优化的 H.264、HEVC,外加硬件加速的 AV1 解码。AV1 这一点尤其关键——流媒体平台全面转向 AV1 已经是明牌,苹果 这次直接把解码做进硬件,等于替未来三五年的视频生态买了票。图形侧,新一代着色器核心支持第二代动态缓存、硬件加速网格着色和第三代光线追踪,图形性能比 M3 Ultra 高出至多 40%。
对 3D 渲染、视觉特效、科学分析这类『对 CPU 和 GPU 峰值性能、统一内存带宽都有极高要求』的工作负载,这颗芯片的回答是全都要。而产业层面的判断是:专业市场是 苹果 必须守住的护城河,而 AI 是它必须攻下的新城。 M5 Ultra 同时服务这两个目标——老用户用媒体引擎和光追继续交年费,新用户为『512GB 统一内存跑大模型』这种别家给不了的配置买单。一位接近 苹果 供应链的分析人士私下聊过一个共识:Mac Studio 这种产品线的意义,从来不是走量,而是给整个 Mac 产品线立技术标杆,顺便收割『工作站替代者』这个高毛利细分。
回头看,这次『无发布会』的低调发布反而是一种自信:参数表本身就是发布会。
小结:焊起来的不只是芯片
M5 Ultra 的真正看点,不是 36 核 CPU 或 80 核 GPU 这些数字,而是 苹果 第一次在 M 系列上展示了四芯片架构的工程能力——4.4 TB/s 片间带宽把四个 die 缝成『一颗芯片』,这是先进封装时代的通行证。而 1.2 TB/s 统一内存带宽加 512GB 内存,则把『桌面上跑前沿 AI 模型』从营销话术变成了参数事实。
往前看,素材中已经出现了 M6 的影子。如果 苹果 保持现在这个节奏,下一场真正的较量,将是这套封装缝合术能否继续拉开与 x86 工作站、与英伟达入门方案的差距。桌面 AI 这张牌桌上,苹果 刚刚加注——后面的牌局,才刚开场。