本页目录

制造 IV · 良率、变异与可靠性

层次:本科少讲、业界核心 | 这是学校与工业界之间落差最大的一页。 前面讲的都是"能不能做出来"。本页讲三件同样要命的事:做出来的有多少是好的(良率)、每一颗都不完全一样(变异)、以及它能用多久(可靠性)。在工业界,一个良率工程师对公司利润的影响,可能超过一个电路设计师。

学习层:良率是缺陷统计、面积与测试决策的乘积

具体谜题:一颗大芯片拆成四颗一定更划算吗?

用负二项模型比较一颗 800 mm2 的单片芯片和四颗各 200 mm2 的 chiplet。取缺陷密度 D0=0.1/cm2、聚集因子 alpha=2。单片面积是 8 cm2,四颗小片各是 2 cm2。你预计单片良率、四颗都良好的系统概率分别是多少?如果封装本身还有 3% 失败率,结论会不会翻转?

先做预测

先估算再开实验:① 面积变为四分之一会显著抬高单颗裸片良率,但系统良率要把四颗同时合格相乘;② 只看 wafer yield 而忽略封装与 KGD,可能把“拆小”收益高估;③ 随机变异会随器件面积缩小而增大,故良率与参数分布不能只用一个二元好/坏标签概括;④ 冗余行列能修复一部分存储缺陷,却要付出面积和测试时间。

最小 mental model:从缺陷场到产品判定

制造先产生带有空间相关性的缺陷场与参数分布;测试再用故障模型、扫描链、BIST 和规格窗口把连续世界压成 bin、pass 或 fail。面积提高了暴露在缺陷场中的机会,器件缩小提高了随机参数波动,而可靠性筛选还会把早期失效从出货队列中移除。良率工程因此同时连接几何、统计、测试和商业成本。

形式机制与不变量

Y(A) = (1 + A D0 / alpha)-alpha,   Cgood ~= Cwafer / (Ngross Y)

若一个系统由 n 颗相同面积的 chiplet 组成,并把封装良率写成 Ypkg,一个透明近似是 Ysystem = Y(A/n)n Ypkg。它不是所有产品的完整成本模型,却明确揭示了“局部良率变好”和“全部同时合格”之间的乘法关系。

变异的另一条不变量是 Pelgrom 型尺度:sigma(Delta Vth) proportional to 1/sqrt(WL)。所以面积缩小同时可能提高密度、降低单颗缺陷暴露面积,却恶化匹配和最小工作电压;测试与 guard band 必须把这两类风险分开记录。

反例与失效边界

  • 负二项公式假设了一类缺陷统计;若缺陷聚集、系统性 wafer map 或工艺漂移主导,单一 D0 不足以预测 yield。
  • 四颗 chiplet 的系统良率不是四颗良率的平均值;KGD 筛选、键合、互连测试和热失效会再乘上额外项。
  • “通过测试”不等于零缺陷:故障模型覆盖有限,扫描链和 ATPG 有测试逃逸,规格边界也可能漏掉长期老化。
  • 冗余修复适用于可定位、可替换的结构;它不能消除所有模拟失配、互连电迁移或封装热循环问题。

交互实验:画出面积、缺陷和冗余的账

无 JavaScript 时的静态读法:取 D0=0.1/cm2、alpha=2。800 mm2 单片对应 8 cm2,Y=(1+0.8*0.1/2)-2=0.510;四颗 200 mm2 小片各为 2 cm2,单颗 Y=0.826,四颗同时良好的概率为 0.8264=0.466。若封装良率 0.97,系统约为 0.452;若有 20% 的失效裸片可由冗余恢复,恢复后的单颗概率可按 Y + 0.2(1-Y) 记账,但不能恢复所有故障。

方案 面积 单颗 Y 系统/封装后 Y 主要边界
单片 800 mm2 0.510 0.510 大面积缺陷暴露
4 chiplet 4 x 200 mm2 0.826 0.466 / 0.452 乘法 + 封装失败

迁移任务:为 SRAM 写良率与测试计划

给一个含 1,024 行、每行 256 bit 的 SRAM 宏,假设每片存在随机坏行、系统性列缺陷和 Vmin 参数分布。请设计一份报告:哪些缺陷用冗余行列修复,哪些必须在 binning 中降级,哪些需要 burn-in 或老化模型;再说明你会如何把测试覆盖率、修复面积、测试时间和出货良率放进同一项成本函数。

一、良率:半导体经济学的中心

良率(yield)= 合格芯片数 / 理论芯片总数。它直接决定成本:

\[\text{单颗成本} \approx \frac{\text{晶圆成本}}{\text{每片芯片数} \times \text{良率}}\]

经典的负二项良率模型:

\[Y = \left(1 + \frac{A D_0}{\alpha}\right)^{-\alpha}\]

\(A\) 为芯片面积,\(D_0\) 为缺陷密度,\(\alpha\) 为缺陷聚集因子。

最关键的推论:良率随芯片面积急剧下降。

良率随芯片面积下降

图 14-1 良率与芯片面积的关系(负二项模型,不同缺陷密度 \(D_0\))。面积增大时良率快速下降:在 \(D_0=0.1/\mathrm{cm^2}\) 下,100 mm² 的芯片良率尚可,而 600 mm² 的大芯片良率已明显恶化。这一条曲线是 Chiplet 存在的最强经济理由——把一颗大芯片拆成若干小芯片,每颗良率都高得多,再用封装拼起来。

这条曲线解释了许多产业现象:

二、变异:没有两个晶体管是一样的

即使没有致命缺陷,器件参数也天然分散。

分类:

Pelgrom 定律(第八页)在此再次登场:\(\sigma_{\Delta V_{th}} \propto 1/\sqrt{WL}\)——器件越小,变异越严重。这是缩放的又一个内在代价:越小越快越密,但也越不一致。

设计上的应对:

SRAM 最先出问题:它用最小尺寸器件、且要求六个管子彼此匹配(第十页),因而是变异的第一受害者,也常是决定芯片 \(V_{min}\) 的模块。

三、测试:怎么知道它是好的

不可能穷举测试:一个有 \(n\) 个输入、\(m\) 个触发器的电路,状态空间是 \(2^{n+m}\)。所以测试必须结构化。

代价:DFT 会占用面积、增加时序负担、且扫描链是一个安全隐患(可用于提取芯片内部状态)。又一处权衡。

测试成本不容忽视:高端芯片的测试时间可达数分钟,测试设备(ATE)极贵,测试成本在总成本中占比可观。

四、可靠性:它能用多久

芯片在使用中会老化。主要机制:

机制 原理 表现
NBTI/PBTI 栅介质界面陷阱累积 \(V_{th}\) 漂移,电路变慢
热载流子注入(HCI) 高能载流子损伤栅氧 参数退化
TDDB 栅介质在电场下逐渐击穿 突发失效
电迁移(EM) 电流带动金属原子迁移,导线出现空洞或短路 互连开路/短路
应力迁移、焊点疲劳 热机械应力 封装级失效

电迁移尤其塑造了设计规则:导线能承载的电流密度有上限(Black 方程给出寿命与电流密度、温度的关系),所以电源网络必须足够宽——这占用了大量布线资源,是先进节点布线拥塞的重要来源。

浴盆曲线与老化筛选:失效率随时间呈浴盆形——早期失效(制造缺陷)、随机失效期、耗损失效期。老化筛选(burn-in)用高温高压加速早期失效,把"早夭"的芯片在出厂前剔除。汽车与航天级芯片的筛选标准远严于消费级,这是同一颗芯片能卖出不同价格的原因之一。

设计中的应对:老化感知设计、留出退化裕量、片上传感器 + 自适应调压(补偿老化引起的变慢)。

五、这一页与全课的连接

良率与变异不是"制造部门的事",它们反向决定了设计:

一句话总结这一页:能设计出来只是及格线;能高良率地造出来、测得出好坏、并且用十年不坏,才是产品。


线三结束。下一线进入研究生专业化与业界前沿——从先进封装与 Chiplet 开始,那正是本页良率曲线所指向的方向。