本页目录

统计 III · 区间估计

点估计给"最佳猜测",区间估计给"猜测 ± 不确定度"。技术上只有一招(枢轴量法),观念上有一个全民级误读要纠正。本页短小,但它的公式表是实验报告与论文里出镜率最高的统计工具。

1. 置信区间:定义与正确解读

95% 置信区间的覆盖率

图 3.195% 置信区间的正确读法:重复抽样,约 20 次里有 1 次的区间盖不住真值 \(\mu\)(红)——"95%"说的是方法的长期覆盖率。

定义 置信水平 \(1 - \alpha\) 的置信区间 \([\hat\theta_L, \hat\theta_U]\)(端点是统计量)满足

\[ P\big(\hat\theta_L \leq \theta \leq \hat\theta_U\big) = 1 - \alpha \]

⚠️ 正确解读(高频误读,值得较真):随机的是区间,不是参数。"95% 置信"指方法的长期频率——反复抽样造区间,约 95% 的区间会罩住真值;对算出来的具体一个区间,真值要么在要么不在,没有"95% 概率在里面"这回事(那是贝叶斯可信区间的语义,需要先验——概率 I)。实用心态:报告区间宽度=报告不确定度,窄区间才有信息量。

2. 枢轴量法(唯一的技术)

流程:1. 找枢轴量 \(G(X_1,\dots,X_n;\theta)\)——含 \(\theta\)分布完全已知(不含未知参数);2. 对已知分布取分位点 \(P(g_{\alpha/2} \leq G \leq g_{1-\alpha/2}) = 1-\alpha\);3. 把不等式反解成 \(\theta\) 居中的形式。

枢轴量从哪来?统计 I 的抽样定理就是枢轴量仓库——那页的 1.2.4. 正是下表的三行。

3. 正态总体置信区间公式表(默写级)

目标 条件 枢轴量 \(1-\alpha\) 区间
\(\mu\) \(\sigma^2\) 已知 \(\frac{\bar X - \mu}{\sigma/\sqrt n} \sim N(0,1)\) \(\bar X \pm z_{\alpha/2}\dfrac{\sigma}{\sqrt n}\)
\(\mu\) \(\sigma^2\) 未知(常态) \(\frac{\bar X - \mu}{S/\sqrt n} \sim t(n{-}1)\) \(\bar X \pm t_{\alpha/2}(n{-}1)\dfrac{S}{\sqrt n}\)
\(\sigma^2\) \(\mu\) 未知 \(\frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n{-}1)\) \(\Big[\dfrac{(n-1)S^2}{\chi^2_{\alpha/2}},\ \dfrac{(n-1)S^2}{\chi^2_{1-\alpha/2}}\Big]\)
\(\mu_1 - \mu_2\) 两总体方差相等 合并方差 t \((\bar X - \bar Y) \pm t_{\alpha/2}(n_1{+}n_2{-}2)\,S_w\sqrt{\tfrac{1}{n_1}{+}\tfrac{1}{n_2}}\)
\(\sigma_1^2/\sigma_2^2\) \(F(n_1{-}1, n_2{-}1)\) \(\Big[\dfrac{S_1^2/S_2^2}{F_{\alpha/2}},\ \dfrac{S_1^2/S_2^2}{F_{1-\alpha/2}}\Big]\)

(χ² 与 F 区间不对称——这两个分布本身不对称;正态与 t 的区间是"点估计 ± 裕量"的对称形。)

4. 大样本区间(非正态总体的通行证)

CLT(概率 V)兜底:\(n\) 大时 \(\frac{\bar X - \mu}{S/\sqrt n} \overset{\cdot}{\sim} N(0,1)\),第一行公式近似通用。比例区间(民调/A-B 实验的那个公式):\(\hat p \pm z_{\alpha/2}\sqrt{\dfrac{\hat p(1-\hat p)}{n}}\)

样本量设计(区间反着用):要求半宽 \(\leq d\),解 \(z_{\alpha/2}\frac{\sigma}{\sqrt n} \leq d\)

\[ n \geq \Big(\frac{z_{\alpha/2}\,\sigma}{d}\Big)^2 \]

精度加一倍 ⇒ 样本量四倍(\(1/\sqrt n\) 定律的又一次出场,概率 V Monte Carlo 同款)。

🔗 AI 衔接:模型评估的误差条——测试集准确率是比例估计,\(n\) 张测试卡片给出的准确率带着 \(\pm z\sqrt{\hat p(1-\hat p)/n}\) 的先天噪声;两个模型准确率差 1% 而误差条 ±2% 时,"A 比 B 好"是噪声不是结论(ai 课 10 讲"自己的 10 道题"要配这个意识;正式对比走统计 IV 的检验)。

5. 典型例题

例 1(t 区间全流程) 某工艺 \(n = 16\) 次测得 \(\bar X = 503,\ S = 6\),求 \(\mu\) 的 95% 置信区间。 \(\sigma\) 未知走 t:\(t_{0.025}(15) = 2.131\),区间 \(503 \pm 2.131 \times \frac{6}{4} = [499.8,\ 506.2]\)

例 2(方差区间) 同数据求 \(\sigma^2\) 的 95% 区间。 \(\chi^2_{0.025}(15) = 27.49,\ \chi^2_{0.975}(15) = 6.26\),区间 \(\big[\frac{15 \times 36}{27.49}, \frac{15 \times 36}{6.26}\big] = [19.6,\ 86.3]\)。(宽得吓人——方差比均值难估得多,\(n=16\) 对方差推断是小样本。)

例 3(样本量设计) 民调想把支持率估到 ±3%(95% 置信),最坏情形 \(p = 0.5\)\(n \geq \big(\frac{1.96 \times 0.5}{0.03}\big)^2 \approx 1068\)——新闻里民调样本量约一千的出处。\(\blacksquare\)


下一页:统计推断的另一半版图——假设检验:两类错误、p 值的正确姿势、正态总体检验全表。