本页目录

前沿 I · 先进封装与 Chiplet

层次:硕博方向 + 当前业界最热的领域之一 | 核对于 2026-07。 封装曾经是芯片制造中最不起眼的后段工序——把裸片装进塑料壳、引出管脚。过去十年它变成了行业最重要的创新战场之一。 原因在前面几页已经埋好:缩放变贵(第四页)、大芯片良率低(第十四页)、模拟不缩放(第八页)、存储墙(第十页)。封装是这四个问题的共同出口。

学习层:Chiplet 把良率收益换成互连、封装与热的系统账

具体谜题:拆成四块后,系统一定更便宜更快吗?

一颗 600 mm2 的逻辑系统可以做成单片,也可以拆成 4 颗各 150 mm2 的 chiplet。假设缺陷模型给出单片良率 0.59、小片良率 0.86,每个跨裸片比特的互连能耗为 2 pJ,工作负载每次需要跨裸片搬运 8 Gbit。若四颗同时合格后还要乘 0.96 的封装良率,四芯粒的“良率收益”能否抵消 16 mJ 的通信能耗与 KGD 测试?不要只看裸片面积,先列系统边界。

先做预测

先判断三种情况:① 通信密集的模块应尽量留在同一裸片,哪怕小片良率略低;② 四颗小片的系统良率必须乘起来,不能直接拿 0.86 当整机良率;③ 2.5D 并排和 3D 堆叠的互连距离相近,但 3D 的热边界不同;④ 如果跨裸片流量从 8 Gbit 降到 0.8 Gbit,Chiplet 的系统权衡可能翻转。实验会让你调通信流量而不是只看封装层数。

最小 mental model:功能划分 + 连接图 + 热路径

把系统表示为带权图:节点是裸片,边权是跨裸片通信量,节点权是面积、功耗和工艺需求。切分降低每个节点的面积与工艺耦合,却把被切断的边变成昂贵的物理互连;堆叠还改变热阻网络。Chiplet 的好坏不是由“芯粒数”单独决定,而是由切分后的图割、KGD、封装良率和散热共同决定。

形式机制与不变量

Ysystem = [Y(A/n)]n Ypkg,   Elink = Bcross ebit,   Atotal = sumi Ai

在固定总面积 Atotal 下,切成 n 颗的面积不变量是各裸片面积之和仍等于总面积;系统良率却是每颗合格事件的乘积。跨裸片通信能耗与切割边上的比特数 Bcross 线性增长,互连能效 ebit 可以用 pJ/bit 记账。单片的这个玩具模型没有跨裸片通信项,拆分后的系统才需要把封装良率和通信能耗一并加入。3D 还要把局部功率密度和热阻放进约束,不能只沿用平面良率模型。

实验的决策规则是“在给定封装良率、通信量和温度预算下,选择系统良率与互连能耗都可接受的切分”。它刻意不把任何厂商协议或实测 benchmark 当成常数。

反例与失效边界

  • chiplet 并不自动降低总成本:封装基板、中介层、测试、已知良好裸片筛选和供应链管理会增加固定项。
  • 系统良率的独立乘法假设会被共享工艺缺陷、同批次相关性和封装热点打破。
  • 互连带宽不是只有线长;协议、SerDes、时钟域、缓存一致性和软件映射也会增加 latency 与能耗。
  • 3D 堆叠可以缩短距离,却可能把高功耗裸片埋在热路径中;热失效会使“密度提升”没有可用频率。

交互实验:在 yield、通信与热之间找可行点

无 JavaScript 时的静态读法:取总面积 600 mm2、单片良率约 0.5917、4 chiplet 每颗良率约 0.8653、封装良率 0.96。单片系统良率约 0.592;四芯粒约 0.86534*0.96=0.538。单片没有跨裸片通信项;四芯粒跨裸片通信 8 Gbit、互连能耗 2 pJ/bit 时,额外通信能耗是 16 mJ;如果流量只有 0.8 Gbit,则为 1.6 mJ。这个玩具例子说明:拆分的收益必须与系统良率和通信图一起看。

切分 裸片面积 裸片合格概率 封装后系统 Y 跨裸片能耗(8 Gbit)
单片 600 mm2 0.592 0.592 0
4 chiplet 4 x 150 mm2 0.865 each 0.538 16 mJ

迁移任务:为 AI 封装做一次图切分

把一个计算裸片、两个 HBM 堆栈、一个 I/O 裸片和一个模拟传感裸片画成带权图。给每条边标注带宽需求、可接受 latency 与 pJ/bit;给每个节点标注工艺、功耗、热路径和 KGD 风险。提出一个 2.5D 方案和一个 3D 方案,再写出你会用来否决其中一个方案的最小证据集合。

一、为什么封装突然重要

四条因果链在此汇合:

  1. 良率经济学(第十四页):良率随面积急剧下降 → 把大芯片拆小;
  2. 掩模版场尺寸上限(第十一页):单颗芯片面积有物理上限 → 想要更大算力必须拼;
  3. 异质集成需求(第八页):逻辑要最先进节点,模拟/IO/存储不需要 → 按需分别选节点;
  4. 存储带宽(第十页):需要把存储放得极近且总线极宽 → HBM。

结论:"在一颗裸片上做完一切"不再是最优解。转向"分而治之,再拼装"。

二、Chiplet:把芯片当乐高

Chiplet(芯粒):把原本单片的 SoC 拆成若干功能裸片,分别制造,再封装集成。

收益:

代价(必须诚实列出):

三、封装技术的阶梯

技术 特征 用途
传统引线键合 金线连接,成本低 低端、成熟产品
倒装焊(flip-chip) 裸片翻转,用凸点直连基板 高性能通用方案
2.5D(硅中介层) 多裸片并排放在硅中介层上,中介层内有高密度布线 HBM + 逻辑的标准方案
3D 堆叠(TSV) 裸片垂直堆叠,硅通孔穿透连接 HBM 内部、3D 缓存
混合键合(hybrid bonding) 铜-铜直接键合,无凸点 键合间距可到微米级,当前最前沿

关键指标是互连密度与能效:从引线键合到混合键合,单位面积的连接数提升了数个数量级,每比特传输能耗大幅下降。混合键合是当前把裸片"缝"得最紧的技术,被用于 3D 缓存堆叠与高端图像传感器等。

HBM(高带宽存储):把多层 DRAM 裸片用 TSV 垂直堆叠,通过硅中介层以极宽的总线(上千位)与逻辑裸片相连。

四、把系统重新划分

Chiplet 迫使设计者重新思考一个问题:功能该如何在裸片间划分?

划分原则:

这与计算机体系结构中的划分问题、乃至分布式系统的设计权衡高度相似(🔗 cs 站)——只是这里的"网络延迟"以皮秒计,"带宽成本"以皮焦耳每比特计。

3D 堆叠带来的架构机会:把 SRAM 直接堆在逻辑上方,可以获得远超平面布局的缓存容量与带宽——这是缓解存储墙最直接的物理手段,已在商用产品中出现。

五、热:新的主要约束

堆叠让散热变得根本性地困难:

应对:热感知的布局与堆叠顺序、微流道液冷(研究中)、动态热管理(片上温度传感器 + 调频调压,又一个片上控制回路)。

一个判断:在 3D 集成时代,热而非晶体管,正在成为限制集成度的第一约束。这是从"电子学问题"转向"热-机-电协同问题"的转折。

六、这如何改变了"摩尔定律"

行业出现了一个说法:"系统级缩放"取代"器件级缩放"——衡量进步的指标从"晶体管有多小"变成"单位体积/功耗内能集成多少功能"。

含义:

七、要点


下一页:如果搬运数据这么贵,能不能干脆在存储里做计算?新型存储器与存内计算——一条试图绕开存储墙的路。