何庭波发了篇论文,光刻叙事慌了
何庭波第三篇论文用麒麟2026实测数据回应'三维堆叠必然发烫'质疑:密度提升55%、NPU功耗降66%。韬定律把性能进步与EUV部分解耦,混合键合设备需求曲线由此改写,'五道关口'成为新确定性。
半导体行业最不缺的就是定律,最缺的就是能落地的定律。
2026年9月4日,华为董事、半导体业务部总裁何庭波在中国科学院科技论文预发布平台 ChinaXiv 提交第三篇署名论文《Huawei's τ Chip Was Supposed to Melt?》(预印本编号:ChinaXiv:202609.00093,论文链接),标题本身就带着火药味——直接回应了业内流传已久的那个质疑:三维堆叠,必然发烫。
这是何庭波团队在 ChinaXiv 上公开的第三篇论文,前两篇构成本文讨论的完整脉络:
1. 《Tau: Decoupling Density Scaling from Lithography Nodes via Hybrid-Bonded 3D Integration》(2025年11月,链接)——首次系统提出“性能-制程解耦”命题,即下文“韬定律”的原始出处;
2. 《Thermal Co-design of Logic-Folding Stacked SoC》(2026年3月,链接)——给出热协同设计的仿真与工程方法;
3. 本篇——第一次拿量产芯片的分模块实测数据说话。
需要提前说明两点,以免误读:
- “韬定律”并非论文中的正式术语,而是业界借用 τ 芯片之名,对第一篇论文中那条核心命题的概括——芯片的密度与能效提升,可以主要由三维堆叠的键合间距代际微缩驱动,与光刻制程代际部分解耦,其量化指标是键合间距与顶层金属间距之比(Ratio)向 1 收敛。华为官方口径中并未使用“定律”一词,这一点读者应心中有数。
- 本篇为预印本,未经同行评审。以下数据均转引自论文自述及公开报道,口径为华为单方披露,尚待第三方独立验证。
这篇论文的分量,不在论文本身,而在于它第一次拿量产芯片的分模块实测数据说话。换句话说,这不是实验室的PPT,是已经卖出去了的芯片。
更值得琢磨的是另一层:韬定律试图改写的,不是一条技术路线,而是整个半导体产业的能力分布。性能进步与光刻制程,正在被部分解耦——这对先进制程受限的玩家意味着一条新路径,对全球设备与材料供应链也意味着一条新的需求曲线。
📉 “三维堆叠必发烫”,被一篇论文正面掀了
先说这场争论的来龙去脉。
三维堆叠芯片从诞生那天起,就背着一口锅:晶体管往上摞,散热面积不增反降,热量憋在夹层里散不出去——业界私下甚至有个说法,“τ芯片按设计目标,本来是要熔的”。这也是论文标题《Was Supposed to Melt?》的出处,何庭波 显然是听到了这些声音,索性用数据回敬。
她的回应方式很行业老手:不谈理念,只给量产芯片的分模块实测数据。
先交代对比基线,这是解读这组数字的前提:论文中所有提升幅度,均以上一代麒麟旗舰(同为海思设计、采用传统平面架构的 SoC)为基准,等性能(iso-performance)条件下测得,不是跨厂商对比。
核心数据如下——麒麟2026 的晶体管密度从每平方毫米 1.55 亿颗提升至 2.38 亿颗,提升幅度 55%。功耗端的数字更扎眼:等性能条件下,NPU 功耗下降 66%,GPU 下降 58%,CPU 性能核下降 41%;NPU 功率密度更是下降了 73%。
发热这个问题,被数据直接摁住了。
| 指标 | 数据 | 基线口径 |
|---|---|---|
| 晶体管密度 | 1.55 亿/mm² → 2.38 亿/mm²(+55%) | 对比上代麒麟平面 SoC;作为参照,台积电 N3 逻辑密度约 2.1 亿/mm²(厂商公开口径,测试方法不同,不可直接画等号) |
| 等性能 NPU 功耗 | 下降 66% | 等性能(iso-performance)条件 vs 上代麒麟 |
| 等性能 GPU 功耗 | 下降 58% | 同上 |
| 等性能 CPU 性能核功耗 | 下降 41% | 同上 |
| NPU 功率密度 | 下降 73% | 单位面积散热压力指标 |
这里要注意两个细节:其一,这些是分模块实测,不是整机跑分。手机 SoC 宣传里最常见的把戏是拿峰值跑分说话,而分模块功耗恰恰是最难美化的指标。其二,密度数字的口径(是否计入 SRAM、单元定义是高密度还是高性能库)会显著影响可比性,论文附录给出了单元库定义,跨厂商比较时须先对齐口径。
据多位接近人士的说法,华为这次选择直接公开模块级数据,就是冲着“封口”去的——用一份论文,终结一场持续了数年的技术路线之争。
🔧 不是算得更少,是搬得更少
数据漂亮,机理是什么?这是很多人看热闹时会漏掉的关键。
答案六个字:搬得更少,不是算得更少。
传统平面芯片里,信号在硅片表面水平奔跑,走线动辄几毫米,每一次搬运都是功耗、都是延迟、都是发热。逻辑折叠(Logic Folding)干的事情,是把水平长走线换成垂直短互连——上层晶圆和下层晶圆面对面摞起来,原来要横穿半个芯片的信号,现在垂直跨一层就到了。
数据支撑很硬:典型核心走线缩短约 20%,关键路径最高缩短 70%。更直观的一个数字是时钟缓冲器数量,从 4.36 万个降至 1.9 万个——几乎砍掉了一半还多。时钟树历来是芯片功耗大户,缓冲器减半,功耗和发热自然同步回落。
这套逻辑在架构层面其实并不新鲜——学术界对逻辑折叠的讨论已持续多年,新鲜的是它在量产芯片上跑通了。行业里懂逻辑折叠的人不少,能把键合良率、热管理、良率成本三者同时做平的,一只手数得过来。
这背后是 海思 多年的积累,也与 何庭波 团队从芯片设计到工艺封装的全链条布局有关——顺带一提,她也是那篇著名的备胎宣言《十年磨一剑》背后的灵魂人物。从备胎到正面上桌,这条线本身就是一部产业史。
📊 放到全球坐标系里看:竞品走到了哪一步
要判断这组数据的意义,必须放进全球先进封装的坐标系里。目前三维堆叠的主流玩家及其公开进展如下:
| 玩家 | 技术路线 | 互连方式 | 公开互连间距 | 量产状态 |
|---|---|---|---|---|
| 台积电 | SoIC(3D Fabric) | 混合键合 | 约 6–9μm,路线图规划至更低 | 已量产,用于 AMD 与苹果相关产品 |
| 英特尔 | Foveros / Foveros Direct | 微凸点 → 混合键合 | Foveros Direct 宣称可至 10μm 以下,下一代规划约 3μm | Foveros 已量产,Direct 在推进中 |
| 三星 / SK海力士 | HBM 堆叠(MR-MUF / TC-NCF) | 微凸点 | μm 级(HBM4 世代) | 大规模量产 |
| 华为 τ / 麒麟2026 | 逻辑折叠 + 混合键合 | 混合键合 | 论文宣称已量产 1000nm 级,路线图至 480nm | 手机 SoC 量产 |
如果华为披露的口径准确,其宣称的键合间距大幅领先于台积电、英特尔公开的混合键合水平——但恰恰因为领先幅度过大,这个数字需要保留审慎态度:不同厂商对“间距”的定义(键合垫间距、有效互连密度)未必一致,且预印本数据未经第三方复现。在独立验证出现之前,把它当作“论文宣称”而非“行业事实”更稳妥。
此外必须指出:解耦红利并非华为独享。台积电的 SoIC 已在高端产品上量产多年,英特尔的 Foveros Direct 路线图同样激进,三星在 HBM 上积累深厚。韬定律描述的是一条全行业都在走的方向,华为的特殊性在于——它是被 EUV 限令逼着走通这条路的第一个玩家,且走通在了手机 SoC 这个对功耗最敏感的场景上。
📈 与EUV脱钩,才是韬定律的真正杀招
如果说前面是技术层面的事,这一节是产业层面的事。
传统半导体进步遵循摩尔定律:性能提升主要靠光刻制程微缩,而微缩的钥匙握在 EUV 光刻机手里。谁拿到 EUV,谁就能继续进步;拿不到,进步就停摆。这套叙事统治了行业二十年。
韬定律试图改写的正是这一点:它把性能进步与光刻制程部分解耦。制程不动的条件下,靠三维堆叠和逻辑折叠,密度照样提升 55%、功耗照样大幅下降。
解耦之后,设备需求的曲线跟着改写。混合键合间距有一条清晰的代际路线:1500nm → 1000nm → 720nm → 480nm。每前进一步,就是一代新设备需求。这条路线完全脱钩于 EUV 进度,跨产品、跨年份,是一条确定性较强的需求曲线——对晶圆厂和设备商的产能规划而言,确定性恰恰是最贵的三个字。
还有一个更硬核的指标:Ratio,即键合间距与顶层金属间距的比值。目前行业趋势是 Ratio 向 1 收敛——当键合间距追上顶层金属间距,垂直互连的密度将完全对齐水平布线密度,三维堆叠就不再是“辅助手段”,而是与平面微缩平起平坐的主路线。
对被卡在先进制程门外的玩家来说,这是一条被重新打开的路;对全球设备与材料供应商来说,这是一块新增的需求。两条叙事,同时成立。
⚠️ 五道关口,产能与供应链流向哪里?
能力分布改写之后,下一个问题自然是:产业链的瓶颈与机会在哪里?
在 Ratio 向 1 收敛的过程中,构成刚性需求的是“五道关口”:ALD 超薄绝缘膜、TSV 深孔刻蚀、晶圆减薄 CMP、混合键合设备、量检测。
拆开看每一关的门道:
- ALD 超薄绝缘膜:两层晶圆面对面贴合,介质层厚度直接决定键合质量与寄生电容。膜越薄越均匀,键合间距才能越小。
- TSV 深孔刻蚀:硅通孔是垂直互连的“电梯井”,深宽比要求随间距微缩一路抬升,刻蚀均匀性是良率命门。
- 晶圆减薄 CMP:晶圆要磨到几十微米厚才能堆叠,减薄后的平整度与应力控制,决定键合成败。
- 混合键合设备:核心中的核心,对准精度要求已达亚微米级。
- 量检测:键合界面是看不见的,全靠检测设备把关,缺陷漏检一片,整批报废。
这五道关口,每一道都是刚性需求,且随代际路线推进持续加码。与传统光刻机一家独大的格局不同,这五个环节的全球竞争格局更分散,后来者的切入空间也更大。据多位接近设备产业链的人士透露,键合间距每下一代的设备招标,都在被多家厂商紧盯——这是一条多数人都能看见的确定性曲线。
当然,也要泼半盆冷水:需求确定,不代表所有环节都能吃到。五道关口的技术壁垒差异极大,量检测和键合设备的壁垒远高于 CMP 减薄,行业洗牌在所难免。
🧯 泼一盆更冷的水:这条路线的四点局限
用数据说话,也要用数据之外的常识说话。韬定律路线至少有四点局限,论文本身着墨不多,但任何严肃的技术评估都绕不开:
1. 散热极限只是被推迟,不是被消灭。 功率密度下降 73% 了不起,但堆叠层数继续增加时,热量终究要从有限的表面积散出去。热瓶颈没有消失,只是从“界面发烫”转移到了“顶层散热窗口”和整机散热设计上。第一篇论文的标题是问号而非句号,原因就在这里。
2. 逻辑折叠对设计工具链的要求是断代式的抬升。 跨层时序收敛、跨层静态时序分析、热-电联合仿真,每一项都在挑战现有 EDA 工具的能力边界。而主流 EDA 三巨头受地缘规则约束,海思的工具链能否持续支撑下一代设计,是比单点工艺更长期的变量。
3. 良率与成本账还没算完。 键合对颗粒缺陷极度敏感,一片报废、整批连坐。论文没有披露量产良率与单颗成本,而“技术跑通”与“成本打得过平面微缩”是两回事。在台积电等对手仍能按节奏推进平面制程的前提下,这条路线的成本竞争力尚未被证明是普适的——它目前更多是“受限条件下的最优解”。
4. 部分解耦不是替代,摩尔定律没有停。 GAA 晶体管、背面供电、CFET 等平面内的微缩手段仍在推进。韬定律描述的是性能来源的多元化,不是光刻微缩的终结。把它读成“摩尔定律已被绕过”,是对原论文最常见也最要命的误读。
一句话总结:这条路线的价值,在于它证明了被锁住制程的玩家仍有一条可走的路;它的边界,在于这条路目前的成本、工具链与散热约束都还清晰可见。
💡 结语:定律的生命力,在于有人拿产线验证它
回到开头:半导体行业最不缺定律,最缺能落地的定律。
何庭波 这篇论文的价值,用一句话概括:它把一场“三维堆叠会不会发烫”的技术口舌之争,变成了一份可以逐项验证的实测账单,并且顺手勾勒出了设备端的价值分布。密度 +55%、NPU 功耗 -66%、功率密度 -73%——数字摆在那里,质疑声自然就小了。
但数字之外,保持清醒同样重要:这是预印本,是单方口径,良率与成本未披露,竞品也没有原地踏步。韬定律要真正立住,接下来要过的关是——第三方复现、跨代量产的良率爬坡、以及在设计工具链上的持续自持。
更长的剧本在后面。当 Ratio 持续向 1 收敛,键合间距从 480nm 继续下探,性能与光刻解耦的程度还会加深。届时不只是华为,所有在先进制程上受限的玩家,都会重新评估自己的技术路线优先级;而设备产业链上的每一道关口,都会长出新故事。
一条定律能否立住,不看论文引用量,看的是有没有量产线和产品真正按它的路线图走。目前看,这道题的答案,正在一代接一代的键合间距里慢慢显形。