本页目录
概率 V · 极限定理
概率论的收官页回答一个哲学级问题:为什么随机的世界里有稳定的规律?答案两条:大数定律(频率稳定到概率、平均稳定到期望——统计学存在的前提)与中心极限定理(大量独立扰动之和趋向正态——正态分布无处不在的原因)。工具是两把不等式和特征函数。
学习层:平均之后,谁在变成钟形?
1. 具体谜题:单件不像正态,平均为什么能像?
想象一条生产线:单件误差可能在一个区间内均匀分布,也可能明显右偏,还可能因为两种工艺路线而形成双峰。质检员每次抽取 \(n\) 件,报告平均误差。单件误差明明没有钟形,为什么“平均误差”常常可以用正态曲线描述?这里的“常常”又依赖什么?
关键是不要把两个随机对象混成一个:\(X\) 是一次观测,\(\bar X_n\) 是 \(n\) 次观测的平均。中心极限定理讨论的是后者在标准化以后呈现的分布形状,不是宣称每个 \(X_i\) 自己会变成正态。
2. 先预测:在碰实验之前写下三句话
先不操作下面的图,预测三件事:
- \(n=1\) 时,均匀、右偏、双峰三种母分布的直方图会不会已经像标准正态?
- 增大 \(n\) 时,原始平均 \(\bar X_n\) 的中心和宽度会怎样变化?把它换成 \(Z_n=\sqrt n(\bar X_n-\mu)/\sigma\) 后,哪个变化被消除了?
- 把“每次平均里取多少个样本”从 \(n\) 改成“重复实验多少次”会不会也让单次分布变正态?
第三问很容易混淆:重复次数只让经验直方图画得更稳定;它不是 CLT 里的样本量 \(n\)。
3. 最小模型:LLN 管位置,CLT 管形状
令 \(X_1,X_2,\ldots\) 独立同分布,
先把两个结论并排放好:
- LLN:\(\bar X_n\xrightarrow{P}\mu\)。它说平均值越来越集中在 \(\mu\) 附近,是关于“位置/误差大小”的结论;并且 \(D\bar X_n=\sigma^2/n\),所以原始平均的波动尺度是 \(\sigma/\sqrt n\)。
- CLT:\(Z_n=\dfrac{\bar X_n-\mu}{\sigma/\sqrt n}=\dfrac{\sum_{i=1}^nX_i-n\mu}{\sigma\sqrt n}\xrightarrow{d}N(0,1)\)。它先移走中心、再除以自然波动尺度,讨论剩下的“形状”。
因此常见的有限样本写法
是近似,不是对每个有限 \(n\) 的等式。它的好坏依赖母分布和 \(n\);偏斜或尾部较重的分布往往需要更大的 \(n\) 才能看出对称的钟形。
4. 可操作实验:让三个母分布接受同一把尺子
实验把每次平均转换为
再叠加标准正态密度 \(\varphi(z)=(2\pi)^{-1/2}e^{-z^2/2}\)。请选择均匀、偏斜或双峰分布,拖动 \(n\),观察经验直方图如何从母分布的个性走向共同的参考曲线。默认重复 \(R=2000\) 次,也可切换为500或8000;同一母分布与 \(n\) 使用固定种子,增加 \(R\) 会保留较小 \(R\) 的样本前缀。这是有限精度伪随机模拟,不是独立性的证明。双峰模型具体为 \(X=S+U\),独立 \(S=\pm1\) 各半、\(U\sim U(-0.2,0.2)\),故均值0、方差 \(76/75\)。第二张图使用同一批数值,直接显示原始平均在固定横轴上的收缩。
无 JavaScript 时的静态读法:实验比较 \(U(0,1)\)、均值为 \(1\) 方差为 \(1\) 的指数分布,以及由两个对称小区间组成的双峰分布;三者都满足 \(0<\sigma^2<\infty\)。每次重复取 \(n\) 个独立样本,绘制 \(Z_n=\sqrt n(\bar X_n-\mu)/\sigma\) 的经验直方图,并与 \(N(0,1)\) 的密度曲线比较。\(n=1\) 时不会自动正态;增大 \(n\) 只是在有限样本下逐渐改善近似,重复次数 \(R\) 只影响直方图的平滑程度。
5. 误区与边界:实验没有替定理放宽条件
- CLT 不是 LLN 的漂亮画法:LLN 关心 \(\bar X_n\) 是否靠近 \(\mu\);CLT 关心标准化后的 \(Z_n\) 是否在分布意义下接近 \(N(0,1)\)。一个说“落点”,一个说“形状”。
- 有限方差是经典版本的门槛:这里需要独立同分布和 \(0<\sigma^2<\infty\)。若方差不存在,不能把这条 Lindeberg–Lévy CLT 直接套上去;可能需要完全不同的极限理论,而不是“多取样本就一定正态”。
- 有限 \(n\) 没有统一魔法数字:\(n\ge30\) 只是某些教材场景的经验口号,不是定理。偏斜、重尾、离散或双峰母分布的有限样本误差可能不同;Berry–Esseen 这类速率结论还会加入更强的矩条件。
- 标准化使用的 \(\mu,\sigma\) 是总体参数:实验知道它们,是为了隔离 CLT 的机制;真实数据里若用估计量替代,还会引出统计推断中的额外误差。
6. 回到正式定理:直方图应该翻译成什么句子?
最后把画面翻译回严格表述:对独立同分布的 \(X_i\),只要 \(EX_i=\mu\) 且 \(0<DX_i=\sigma^2<\infty\),就有
这里的箭头是依分布收敛:它保证边界在极限分布下概率为零的区间,其概率在极限处匹配,并不保证某一次有限样本的直方图、某一个样本点或每个尾部概率都已经精确等于正态。带着“独立同分布—有限正方差—正确标准化—有限样本只作近似”这四个检查项,再回看下面的正式证明与应用,CLT 的威力和边界会同时保留下来。
1. 两个不等式:从“平均代价”约束坏事件
若 \(X\ge0\)、\(EX<\infty\) 且 \(a>0\),则 \(X\ge a\mathbf1_{\{X\ge a\}}\);两边取期望,得到 Markov 不等式
对平方偏差 \((X-EX)^2\) 使用它,在方差有限、\(\varepsilon>0\) 时得到 Chebyshev 不等式:
它不要求正态,也不需要知道密度,却可能很松。例如 \(EX=100\)、\(\operatorname{Var}X=10\) 时,\(P(80<X<120)\ge0.975\)。这里是保守下界,不是估计概率的精确值。更强的集中界通常利用有界性、矩母函数或其他尾部条件;不能无条件把多项式界换成指数界。
2. 三种收敛:一次路径与一张分布图是不同对象
| 收敛 | 定义 | 回答的问题 |
|---|---|---|
| 几乎必然 \(X_n\to X\) a.s. | \(P(\lim_nX_n=X)=1\) | 固定一条随机记录,最终是否趋近? |
| 依概率 \(X_n\xrightarrow P X\) | 每个 \(\varepsilon>0\) 都有 \(P(\lvert X_n-X\rvert>\varepsilon)\to0\) | 第 \(n\) 次偏差明显的概率是否消失? |
| 依分布 \(X_n\xrightarrow d X\) | 在 \(F_X\) 的每个连续点,\(F_{X_n}(x)\to F_X(x)\) | 分布函数是否趋近? |
前两种要把随机变量放在同一个概率空间比较;依分布收敛只比较各自的分布。\(a.s.\Rightarrow P\Rightarrow d\),一般不能反推。
同分布却不靠近。 令 \(X=\pm1\) 各半,所有 \(X_n=-X\)。每个 \(X_n\) 与 \(X\) 同分布,因此依分布收敛;但 \(|X_n-X|=2\) 恒成立,不依概率收敛到 \(X\)。有一个有用例外:若分布极限是常数 \(c\),则 \(X_n\xrightarrow d c\) 等价于 \(X_n\xrightarrow P c\)。
坏事件概率趋零,却沿每条路径反复发生。 令 \(U\sim U[0,1)\),对每个 \(m=0,1,\ldots\),依次列出
第 \(m\) 组每个变量取 1 的概率为 \(2^{-m}\),所以整列依概率趋零;但固定任何 \(U\),每一组中都恰有一个 1,且从 \(m\ge1\) 起也有 0,因此不逐点趋零。依概率收敛不是“从某时刻开始再也不偏离”。
3. 大数定律:平均误差缩小的原因
若 \(X_i\) 两两不相关、各有有限方差且 \(\operatorname{Var}X_i\le C\),令 \(A_n=n^{-1}\sum_{i=1}^n(X_i-EX_i)\)。协方差项消失,所以
这证明了相应的弱大数定律。对于独立同分布、均值 \(\mu\)、方差 \(\sigma^2\) 的样本,\(\operatorname{sd}(\bar X_n)=\sigma/\sqrt n\) 是精确等式,不是正态近似。独立 Bernoulli 指示变量的平均就是频率,因此频率依概率趋向事件概率。
强大数定律(本页陈述): i.i.d. 且 \(E|X_1|<\infty\),则 \(\bar X_n\to EX_1\) 几乎必然。这个结论不要求有限方差;上面的 Chebyshev 证明却不能证明这一更强版本。完整证明需要截断、独立性与几乎必然收敛工具,后续可接 测度与收敛。
两个反例划清适用范围:
- 若所有 \(X_i=Z\) 是同一个非退化随机数,平均始终为 \(Z\),不会因重复写下同一数而变稳定。对一般相关样本,\(\operatorname{Var}(\bar X_n)=n^{-2}\sum_{i,j}\operatorname{Cov}(X_i,X_j)\),协方差项不能省。
- 若 i.i.d. \(X_i\) 满足 \(P(X_i>x)=x^{-3/2}\)(\(x\ge1\)),则均值为 3、方差无穷。强大数定律仍适用,但不能套用有限方差的经典 CLT 或 \(\sigma/\sqrt n\) 误差条。
Monte Carlo 对一个固定可积函数取样平均,可由 LLN 得到相合性。“每个固定模型的经验风险趋于期望风险”不能直接推出在同一数据上挑出的最优模型也泛化良好;数据自适应选择还需要一致收敛或其他论证。随机梯度的无偏性则来自抽样机制与期望运算,不能由 LLN 单独推出。
4. 中心极限定理:保留波动,再看极限形状
Lindeberg–Lévy CLT: 对 i.i.d. 样本,若 \(EX_i=\mu\) 且 \(0<\operatorname{Var}X_i=\sigma^2<\infty\),则
原始平均趋向常数,标准化平均却趋向非退化分布:减去 \(\mu\) 是移走中心,乘以 \(\sqrt n/\sigma\) 是把逐渐缩小的波动重新放大。若母分布本来正态,这个标准化结果对每个 \(n\) 都精确正态;一般母分布只有极限结论。
特征函数证明:哪里真正用了有限二阶矩?
令 \(Y_i=(X_i-\mu)/\sigma\),则 \(EY_i=0,EY_i^2=1\)。特征函数 \(\varphi(t)=E[e^{itY_i}]\) 总存在,因为被积函数模为 1。有限二阶矩允许在期望内求两次导数:二阶导数的被积函数被 \(Y_i^2\) 控制,故由支配收敛,\(\varphi''\) 在零点连续。
因此 \(\varphi(0)=1,\varphi'(0)=iEY_i=0,\varphi''(0)=-EY_i^2=-1\),并有
这一步不要求三阶矩。独立性把和的特征函数变成乘积;对每个固定 \(t\),
右端是标准正态的特征函数,且在零点连续。最后使用 Lévy 连续性定理,才从特征函数的逐点极限推出依分布收敛;唯一性定理只说明“同一特征函数不能对应两种分布”,本身不是这一步收敛论证。可参看 Pitman 的概率讲义与连续性定理章节。
并非所有平均都正态化。 独立标准 Cauchy 的特征函数为 \(e^{-|t|}\),所以平均的特征函数为 \([e^{-|t|/n}]^n=e^{-|t|}\)。平均与原变量同分布,既不趋于某个有限均值,也不产生这里的正态极限;它没有有限绝对一阶矩或方差。这个计算比“重尾时要小心”更具体。
CDF 收敛不等于密度或尾部相对误差收敛
若标准化三阶绝对中心矩 \(\beta_3=E|X_i-\mu|^3/\sigma^3<\infty\),可使用一个明确有效的 Berry–Esseen 界:
这里采用 Shevtsova(2011)给出的通用常数上界,不声称它是最新最优值。实验中的均匀、指数、双峰三种母分布分别有 \(\beta_3=3\sqrt3/4\)、\(12/e-2\)、\(1.04/(76/75)^{3/2}\);显示的是真实 CDF 的理论界,不包含用有限重复次数 \(R\) 画直方图带来的经验误差。
这个界控制绝对误差。例如上界 0.01 并不保证一个真实概率约 \(10^{-4}\) 的罕见事件能被准确估计到相对误差 1%。CLT 也不保证有限 \(n\) 的误差随每次增加 \(n\) 单调变小;“至少30个”不是普遍验收标准。
5. 有限样本应用:先明确精确目标,再谈近似
独立同质的 \(n\) 次 Bernoulli 试验,成功率 \(p\in(0,1)\) 固定,计数 \(S\sim\operatorname{Bin}(n,p)\)。由 CLT,\((S-np)/\sqrt{np(1-p)}\) 依分布趋于标准正态。正态连续,而 \(S\) 离散,因此近似 \(P(a\le S\le b)\) 时,常用连续性修正
其中 \(a,b\) 为整数。半格修正对应给每个整数柱分配一个宽度为 1 的区间,但并不消除偏斜误差。若 \(p\) 随 \(n\) 改变,必须重新核对适用条件;比如 \(np\) 保持很小,不能仅凭 \(n\) 很大就宣布正态近似良好。
例:罕见故障计数。 假设 10000 台器件在固定观察期内独立、同概率 0.006 发生一次故障。目标是 \(P(S>80)=P(S\ge81)\)。此时均值 60、方差 59.64,修正后的正态近似为
直接求二项尾和得到约 \(0.00550117\);绝对差约 \(0.00153003\),相对误差约 27.8%。不修正的结果约 \(0.00480201\),在这个点反而偶然更近。因此“加修正”不是逐点误差必然改善的定理;若需要精确罕见事件概率,应计算相应的精确分布或使用有误差控制的方法。若器件共同受温度影响,独立假设也需另行检验。
6. 迁移练习与答案
题 1:四倍样本买到什么?
总体均值 \(\mu=2\)、标准差 \(\sigma=3\)。把每次平均的样本量从 25 提到 100,再把重复次数从 500 提到 2000,分别改变哪个对象?
展开推导
若样本独立同分布,原始平均的期望仍为 2,标准差由 \(3/\sqrt{25}=0.6\) 降到 \(3/\sqrt{100}=0.3\)。标准化变量的理论均值和方差始终为 0、1;其有限样本分布可更接近正态,但不能保证某次直方图每一柱都更接近。增加 \(R\) 不改变 \(\bar X_n\) 或 \(Z_n\) 的真实分布,只改变经验图和经验概率的误差;例如一个固定区间的经验比例,若重复实验独立,其标准误约为 \(\sqrt{q(1-q)/R}\),其中 \(q\) 是该区间的真实概率。
题 2:先验未知分布时,样本量承诺有何不同?
设 i.i.d. 单样本方差为1,希望平均距总体均值不超过 0.01 的概率至少为 95%。比较 Chebyshev 的保证与正态近似给出的设计。
展开推导
Chebyshev 给出 \(P(|\bar X_n-\mu|\ge0.01)\le1/(n\cdot10^{-4})\),因此 \(n\ge200000\) 是仅凭方差就有效的充分条件。正态近似使用 \(1.96/\sqrt n\le0.01\),得到 \(n\ge38416\),但它依赖该样本量下近似足够好;母分布正态时正态分布公式才对有限 \(n\) 精确成立(1.96仍是分位数的取整)。若方差由数据估计,还应处理估计的不确定性。这两个数字回答的是不同强度的保证,不应互换。
题 3:一个有限方差、却可能很慢的例子
令 \(X\sim\operatorname{Bernoulli}(p)\)。求 \(\beta_3\),解释为什么固定很小的 \(p\) 会让 Berry–Esseen 上界变差。
展开推导
中心绝对三阶矩为 \(p(1-p)^3+(1-p)p^3=p(1-p)[p^2+(1-p)^2]\),所以
当 \(p\to0\),它约为 \(p^{-1/2}\),误差上界约为 \(0.4748/\sqrt{np}\)。因此“小概率 × 试验次数”的尺度影响近似,而不只是试验次数本身。本式是绝对 CDF 误差上界,并不为小尾概率提供相同大小的相对误差保证。
继续 统计抽样分布 与 Poisson 过程:前者把极限定理转成推断工具,后者研究随机性随时间怎样积累。