本页目录
统计 I · 统计量与抽样分布
概率论与数理统计的分工一句话:概率论从分布推样本(演绎),统计从样本推分布(归纳)。归纳要有依据,依据就是"统计量自身的分布"——抽样分布。本页立好这套语言,核心资产是三大分布(χ²/t/F)与正态总体抽样定理,它们是后面估计与检验全部公式的发动机。
学习层:同一批数据,四层对象不要串名
1. 具体实例:质检员手里的数字究竟在估计什么?
工厂的总体是所有产品重量的随机变量 \(X\),总体均值 \(\mu\) 和方差 \(\sigma^2\) 是交付前就存在、但通常未知的参数。质检员抽到 \(n\) 件,得到一组观测;把它们平均得到一个统计量 \(\bar X\),换一批样本又会得到另一个数。于是至少有四层:总体参数、一次样本上的统计量、统计量在重复抽样下的分布,以及把统计量当作估计量时的偏差/方差/一致性。
本实验把这四层放在同一张图上。正态总体给出精确抽样分布,指数型总体展示有限样本偏斜但在条件满足时逐渐进入 CLT 近似,带共同冲击的相关样本和 Pareto 重尾则故意撞上边界。
2. 先预测:抽样前先分清四个名词
先不要打开结果:
- \(\mu\) 是总体参数还是样本统计量?\(\bar X\) 是否会因换一批样本而变化?
- \(\bar X\) 的抽样分布是在描述一条观测,还是描述重复抽样所得的许多统计量?增大 \(n\) 会改变哪一层?
- 为什么 \(S^2\) 要除以 \(n-1\) 才对一般总体无偏?“无偏”是否等于每次样本都等于 \(\sigma^2\)?
- CLT 是否对任意依赖结构和任意重尾都自动成立?bootstrap 能否在没有独立性、有限方差或识别条件时无条件替代理论抽样分布?
3. 正式桥:从参数到估计量的四本账
总体参数记作 \(\theta\),样本 \(X_1,\ldots,X_n\) 来自总体;统计量 \(T(X_1,\ldots,X_n)\) 不含未知参数。把统计量用来估计 \(\theta\) 后,定义
偏差是平均意义的差,方差是重复抽样的波动,MSE 把两者放到同一损失尺度;它们都不是“这一次样本离真值多远”的同义改写。
对 i.i.d. 且 \(EX=\mu\)、\(DX=\sigma^2<\infty\) 的样本,\(E\bar X=\mu\)、\(D\bar X=\sigma^2/n\);对正态总体还可得到 \(\bar X\) 与 \(S^2\) 的精确联合结构。经典 CLT 是渐近结论:在独立同分布、有限非零方差等条件下,标准化均值才依分布趋向 \(N(0,1)\)。它不把有限 \(n\) 的近似变成等式,也不覆盖下面的相关/重尾反例。
bootstrap 从观测经验分布中有放回重抽样,条件于当前数据近似估计量的抽样分布。它需要与问题匹配的正则性、独立性或块结构、足够的尾部条件;bootstrap 的一张窄图不是理论条件的豁免,也不能无条件修复偏差、依赖、无限方差或不可识别参数。
4. 可操作实验:先过预测门,再打开抽样分布
实验默认正态总体、\(n=20\)、重复 \(R=120\)、估计量为样本均值、bootstrap 重抽样 \(B=120\)。提交四项预测后,可切换总体、估计量、\(n\)、\(R\) 和 \(B\);总体与bootstrap直方图、适用模型的精确密度、经验偏差/方差/MSE、理论矩以及bootstrap条件标准误会由同一组固定种子数据重算。
JavaScript 失效时的静态 fallback: 默认总体为 \(N(10,4)\)。当估计量为均值时,参数是 \(\mu=10\)、单次统计量是某个样本的 \(\bar X\),抽样分布是重复抽样的 \(\bar X\) 集合,并且精确地有 \(\bar X\sim N(10,4/20)\);bootstrap 只是从一份观测的经验分布近似这份抽样分布。对照模型如下:
| 总体预设 | 参数与抽样结构 | CLT / bootstrap 边界 |
|---|---|---|
| 正态 \(N(10,4)\) | \(\mu=10,\sigma^2=4\);均值抽样分布精确正态 | 正态总体的 t、χ² 结论可用;bootstrap 是近似而非定义 |
| 偏斜 \(\operatorname{Exp}(1)\) | \(\mu=1,\sigma^2=1\);小 \(n\) 的均值仍右偏 | i.i.d. 且有限方差,CLT 只在渐近意义成立 |
| 共同冲击 | \(X_i=Z+\varepsilon_i\),样本内相关 | 平均的波动不按 \(1/n\) 消失;把 i.i.d. CLT 或普通 bootstrap 硬套会失效 |
| Pareto\((1,1.5)\) | 均值为 \(3\),方差不存在 | 经典有限方差 CLT 不适用;普通 bootstrap 不能无条件替代理论 |
样本方差的统计量定义使用 \(S^2=(n-1)^{-1}\sum(X_i-\bar X)^2\);无偏是重复抽样的期望陈述,不是每个 \(S^2\) 都等于总体方差。图中的柱高是固定重复实验的经验抽样分布,金色参考线是所选模型可计算的精确抽样密度:正态/共同冲击均值、它们的样本方差,以及指数总体均值;其余组合不擅自画近似密度。
5. 定理与失败边界:近似必须写出条件
- 总体参数不随样本移动。 \(\mu,\sigma^2\) 是总体的固定特征;\(\bar X,S^2\) 是样本统计量,换样本就会变化。
- 抽样分布不是原始数据分布。 它是把同一个统计量在重复样本上重算所得的分布;\(n\) 进入的是统计量的随机性,而不是把一条观测“变正态”。
- 无偏不等于稳定。 无偏只说 \(E\hat\theta=\theta\);方差、MSE 和一致性还要另算。\(S^2\) 的 \(n-1\) 修正正是均值被估计后损失一个自由度的补偿。
- CLT 是渐近且有条件。 独立性、同分布或适当的 Lindeberg 条件、有限非零方差等假设决定能否使用经典版本;重尾和依赖结构需要另行分析。
- bootstrap 不是无条件替代。 它近似的是条件于数据的经验抽样分布;依赖数据常需 block/bootstrap 结构,极重尾、边界参数、非光滑统计量或模型未识别时,普通 bootstrap 可能不一致。
看见“样本量大所以正态”时,先说清是哪一个统计量、哪一种抽样机制、哪一组条件;看见 bootstrap 标准误时,也要把它放回目标参数和理论抽样分布的语境中。
1. 统计量与枢轴量:计算时能否代入未知数?
在本页的 i.i.d. 抽样模型中,\(X_1,\ldots,X_n\) 是观测前的随机变量,\((x_1,\ldots,x_n)\) 是观测后的数值。统计量是样本的函数,计算规则不能依赖未知参数。因此 \(\bar X\)、\(S^2\) 是统计量;若 \(\mu,\sigma\) 未知,\((\bar X-\mu)/(\sigma/\sqrt n)\) 含有未知参数,不能直接当作可计算统计量。
这种含参数、但分布不依赖该未知参数的组合称为枢轴量。它并非无用:把关于它的概率事件整理成参数的上下界,就得到置信区间。在检验 \(\mu=\mu_0\) 时,用已指定的 \(\mu_0\) 代入,则可得到可计算的检验统计量。具体操作见后续 区间估计。
为什么样本方差除以 n−1?先证明,再解释自由度
设 \(n\ge2\),样本 i.i.d.、均值 \(\mu\)、有限方差 \(\sigma^2\)。展开平方,利用 \(\sum_i(X_i-\bar X)=0\),有精确恒等式
两边取期望:左边为 \(n\sigma^2\),最后一项为 \(n\operatorname{Var}(\bar X)=\sigma^2\),故
“损失一个自由度”是这件事的几何解释:残差向量满足一条线性约束,只能在 \(n-1\) 维子空间中移动;它不能替代上述期望计算。无偏性要求抽样条件,相关数据中 \(\operatorname{Var}(\bar X)\) 不一定为 \(\sigma^2/n\),这个补偿因子也不一定正确。
无偏还不等于每一次准确。若 \(E(\hat\theta-\theta)^2<\infty\),写成 \((\hat\theta-E\hat\theta)+(E\hat\theta-\theta)\) 并展开平方,交叉项期望为零,得到 \(\operatorname{MSE}=\operatorname{Var}+\operatorname{Bias}^2\)。实验的有限 \(R\) 经验数值也满足对应恒等式,但不能由此推出理想总体的 MSE 有限。
2. 正态总体为什么会产生独立的均值与残差?
设 \(X_i\) i.i.d. \(N(\mu,\sigma^2)\),\(\sigma^2>0\),令 \(Z_i=(X_i-\mu)/\sigma\)。向量 \(Z\) 的密度为 \((2\pi)^{-n/2}e^{-\|z\|^2/2}\):它只依赖长度,正交旋转不会改变分布。
取单位向量 \(u=(1,\ldots,1)/\sqrt n\),并补成一组正交基。以这些基向量为行的矩阵记作 \(Q\),则 \(QQ^\top=I\)。令 \(W=QZ\)。由于长度和体积都不变,\(W\) 的密度仍因子化为 \(n\) 个标准正态密度,所以各坐标独立。第一坐标是
其余 \(n-1\) 个坐标是去掉平均方向后的残差;由勾股定理
于是同时得到四条精确结论:
独立性来自正态旋转后的坐标独立,不只来自“两个向量正交”。一般总体也能做相同的代数分解,却不能保证旋转后密度因子化。用样本标准差替代总体标准差后,分母本身随机;它偶尔偏小会放大比值,这解释了 t 分布的厚尾。
3. χ²、t、F:从构造看条件与矩
卡方: 独立 \(Z_i\sim N(0,1)\) 时,\(U=\sum_{i=1}^{\nu}Z_i^2\sim\chi^2_\nu\)。对整数 \(\nu\),自由度就是独立平方项的数目;密度的 Gamma 形式还能推广到任意实数 \(\nu>0\)。其均值为 \(\nu\)、方差为 \(2\nu\)。若两个卡方变量独立,相加后的自由度相加。
Student t: \(Z\sim N(0,1)\)、\(U\sim\chi^2_\nu\) 且两者独立,则
它关于零对称,\(\nu>1\) 时均值才存在且等于零;\(\nu>2\) 时方差为 \(\nu/(\nu-2)\),\(1<\nu\le2\) 时方差无穷,\(0<\nu\le1\) 时不能用对称性宣布均值为零。随着 \(\nu\to\infty\),\(U/\nu\xrightarrow P1\),从而 \(T\xrightarrow dN(0,1)\)。需要多大自由度才可近似,取决于关心的分位数与容许误差,不能用一个固定阈值替代核对。NIST 的 t 分布说明 给出相应密度与矩。
F: 若 \(U\sim\chi^2_m,V\sim\chi^2_\nu\) 独立,则
它只取正值;\(\nu>2\) 时均值为 \(\nu/(\nu-2)\),\(\nu>4\) 时方差才有限。由定义立即有 \(F^{-1}\sim F_{\nu,m}\),以及 \(T_\nu^2\sim F_{1,\nu}\)。若定义左尾分位数 \(q_p(m,\nu)\) 满足 \(P(F\le q_p)=p\),则
写清左尾或右尾约定,才能正确使用分位数表。密度和尾部性质见 NIST 的 F 分布说明。
两组相互独立、各自 i.i.d. 正态且样本量至少为2时,\((S_1^2/\sigma_1^2)/(S_2^2/\sigma_2^2)\sim F_{n_1-1,n_2-1}\)。若方差还相等,可合并估计共同方差,均值差的标准化比值才有相应的精确 t 律;方差不等时不能直接照搬。
4. 同一个实验里的四种总体,理论答案各不同
实验中 \(n\) 是一份样本的观测数,\(R\) 是从理想总体重新生成样本的次数,\(B\) 是给定一份观测后有放回重抽样的次数。固定总体和 \(n\) 时,改变 \(R\) 不改变当前那份观测;改变 \(B\) 不改变总体重复抽样序列;较短的重复序列是较长序列的前缀,方便比较经验波动。
正态 \(N(10,4)\): 均值的理论方差为 \(4/n\),\(S^2\) 的理论均值为4、方差为 \(32/(n-1)\)。实验的金线分别是精确正态密度与缩放卡方密度。
指数 \(\mathrm{Exp}(1)\): \(\bar X\) 精确服从 shape 为 \(n\)、scale 为 \(1/n\) 的 Gamma 分布,所以金线保留有限样本偏斜。\(S^2\) 仍无偏,但不是缩放卡方。若总体四阶中心矩 \(\mu_4\) 有限,展开四次乘积可得
指数总体 \(\sigma^2=1,\mu_4=9\),于是本页使用 \(8/n+2/[n(n-1)]\) 作为精确方差参照,没有擅自画正态总体的卡方曲线。
共同冲击: 每次生成一簇 \(X_i=Z+\varepsilon_i\),其中 \(Z,\varepsilon_1,\ldots,\varepsilon_n\) 相互独立且均为 \(N(0,1)\)。边际方差为2,但样本内共享同一个 \(Z\):
因此 \(S^2\sim\chi^2_{n-1}/(n-1)\),均值为1;若目标仍是边际方差2,偏差就是 \(-1\),MSE 为 \(1+2/(n-1)\)。这里虽然相关,均值依然精确正态;失败的是 i.i.d. 的方差缩放与一致性,不能把“有相关”误读成“必定不正态”。增加同一簇内的 \(n\) 无法平均掉 \(Z\)。
Pareto\((x_{\min}=1,\alpha=1.5)\): 均值为3,方差无穷。独立抽样均值仍由强大数定律趋向3,经典有限方差 CLT 则不能使用;均值估计量的理论 MSE 无穷。每次有限模拟却仍会返回有限数,图上的经验方差和MSE可以看起来不大。软件的有限精度伪随机数还限制了实际能生成的极端值,不能把有限模拟反过来当作“理想尾部矩有限”的证据。
5. bootstrap:把当前经验分布当作另一个总体
观察到 \(x_1,\ldots,x_n\) 后,经验分布 \(\widehat F_n=n^{-1}\sum_i\delta_{x_i}\) 在每个观测位置放概率 \(1/n\)。普通 bootstrap 从这里独立、有放回地抽取 \(n\) 个数,再算统计量。星号 \(E^*,\operatorname{Var}^*\) 表示给定当前数据后的条件期望和方差。这个重抽样机制可参看 CMU 的 bootstrap 讲义。
令 \(m_2=n^{-1}\sum_i(x_i-\bar x)^2=(n-1)s^2/n\)。经验分布的均值为 \(\bar x\)、方差为 \(m_2\),因此无需模拟即可精确得到
注意,这个“精确”只针对当前经验分布;它是否近似真实总体的抽样分布,是另一个需要条件的问题。对样本方差也可计算条件矩。令 \(m_4=n^{-1}\sum_i(x_i-\bar x)^4\),则
实验对照这组精确条件矩与 \(B\) 次重抽样的估计;模拟标准误使用这 \(B\) 个统计量的样本标准差,方差分母为 \(B-1\)。蓝色总体重抽样图与紫色 bootstrap 图没有人为平移到同一中心:后者围绕当前观测,正是它条件于数据的表现。
共同冲击例子中,经验分布只能看到同一簇内的离散程度。\(n\) 增大时,普通 bootstrap 均值 SE 大约按 \(1/\sqrt n\) 降低,而真正跨簇重复抽样的 SE 趋于1。仅有一簇时,增加 \(B\)、或笼统地说“用 block bootstrap”,都无法凭空补出独立簇之间的信息;需要与数据生成结构匹配的额外数据或模型。
6. 精确有限样本结论与大样本替代
非正态的 i.i.d. 总体,只要 \(0<\sigma^2<\infty\),\(S^2\xrightarrow P\sigma^2\)(对 \(X_i\) 与 \(X_i^2\) 用大数定律),再结合 CLT 与 Slutsky 定理,有
这是 Student 化后的渐近正态,不是有限样本精确 \(t_{n-1}\)。它也不会自动给出精确卡方/F律,或恢复一般总体下均值与样本方差的独立性。样本方差的一致性只需有限二阶矩;上节样本方差的有限方差公式需要有限四阶矩,条件强度也不同。
例如正态总体 \(N(21,4)\)、\(n=25\) 时,\(P(\bar X>21.8)=1-\Phi(2)\approx0.0227501\)。这是精确抽样定理加数值求尾;换成仅有相同均值方差的一般总体,就不能称有限样本精确结果。
7. 迁移练习与答案
题 1:把方差事件换成标准分布事件
正态总体方差为4,独立样本量10。求 \(P(S^2>8.04)\),并写清自由度、阈值与尾部方向。
展开推导
由 \((n-1)S^2/\sigma^2\sim\chi^2_{n-1}\),目标等于 \(P(\chi^2_9>9\times8.04/4)=P(\chi^2_9>18.09)\approx0.0341436\)。自由度为9,阈值为18.09,取右尾;不能把 \(S\) 与 \(S^2\)、标准差与方差混用。
题 2:分子分母共享信息会怎样?
\(Z_1,\ldots,Z_5\) 独立标准正态。比较 \(A=Z_1/\sqrt{(Z_2^2+\cdots+Z_5^2)/4}\) 与 \(B=Z_1/\sqrt{(Z_1^2+\cdots+Z_5^2)/5}\)。
展开推导
\(A\) 的分子与分母独立,故 \(A\sim t_4\)。\(B\) 的分母含 \(Z_1^2\),独立性失效;更直接地,\(|B|\le\sqrt5\) 几乎必然,而任何 t 分布都具有无界支持,所以 \(B\) 不服从 t 分布。相同的“正态除以平方和之根”外观不能替代独立性检查。
题 3:重抽样的极限是否等于真正的不确定性?
共同冲击模型中 \(n=100\),某次样本恰有 \(s^2=1\)。比较真实均值 SE、普通 bootstrap 均值的精确条件 SE,以及 \(S^2\) 对边际方差的理论偏差。
展开推导
真实均值 SE 为 \(\sqrt{1+1/100}\approx1.00499\)。bootstrap 条件 SE 为 \(\sqrt{99}/100\approx0.099499\),约小一个数量级。把 \(B\) 提高只会把模拟结果稳定到这个条件值,不能变成跨簇 SE。\(ES^2=1\) 而边际方差为2,故理论偏差为 \(-1\);这与一次 \(s^2\) 的巧合无关。
下一页:点估计。现在能区分一个估计数值与估计方法在重复抽样中的性质,再讨论怎样选择更好的估计量。