本页目录

统计 IV · 假设检验

区间估计问"参数在哪",假设检验问"这个断言站得住吗"。它的逻辑是统计版的反证法:先假设"没有效应"(原假设),若观测数据在此假设下概率小得离谱,就推翻它。本页三件事:把这套逻辑(两类错误、p 值)立严,给出正态总体检验全表,以及纠正 p 值的全民级误读。

1. 基本框架:统计反证法

两类错误 alpha 与 beta

图 4.1两类错误:拒真(第一类 \(\alpha\),\(H_0\) 的右尾)与取伪(第二类 \(\beta\),\(H_1\) 的左尾),临界值一挪二者此消彼长。

要素:原假设 \(H_0\)(默认立场,"无差异/无效应")vs 备择假设 \(H_1\)检验统计量(在 \(H_0\) 下分布已知——又是统计 I 的仓库);拒绝域(统计量落入则拒绝 \(H_0\))。

两类错误

\(H_0\) \(H_0\)
拒绝 \(H_0\) 第一类错误(冤枉好人),概率 \(\alpha\) 正确(功效 \(1-\beta\)
不拒绝 正确 第二类错误(放走坏人),概率 \(\beta\)

\(\alpha\)\(\beta\) 此消彼长(同一样本量下);Neyman–Pearson 原则:先把 \(\alpha\) 钉死在小水平(0.05/0.01——"宁可放过不可冤枉"),在此约束下让 \(\beta\) 尽量小。地位不对称的后果:"不拒绝 \(H_0\)" ≠ "接受 \(H_0\) 为真"——只是证据不足以推翻(无罪判决 ≠ 证明清白)。增大样本量是同时压两类错误的唯一通道。

流程五步:设 \(H_0/H_1\) → 选统计量 → 定 \(\alpha\) 查临界值 → 算样本值 → 落拒绝域则拒绝,报告结论。

2. p 值:定义与正确姿势

定义 p 值 = \(H_0\) 为真的前提下,出现"不弱于当前观测"这么极端数据的概率。\(p < \alpha \iff\) 落入拒绝域——p 值是"检验结果的连续版",报告 \(p = 0.003\) 比报告"在 0.05 下显著"信息量大。

⚠️ 全民级误读纠正(与统计 III 的置信区间误读并列):

3. 正态总体检验全表(与统计 III 的区间表同源对偶)

单总体(\(H_0: \mu = \mu_0\)\(\sigma^2 = \sigma_0^2\)):

目标 条件 统计量(\(H_0\) 下分布) 双侧拒绝域
\(\mu\) \(\sigma\) 已知(z 检验 \(Z = \frac{\bar X - \mu_0}{\sigma/\sqrt n} \sim N(0,1)\) \(\lvert Z\rvert > z_{\alpha/2}\)
\(\mu\) \(\sigma\) 未知(t 检验,主力) \(T = \frac{\bar X - \mu_0}{S/\sqrt n} \sim t(n{-}1)\) \(\lvert T\rvert > t_{\alpha/2}(n{-}1)\)
\(\sigma^2\) χ² 检验 \(\chi^2 = \frac{(n-1)S^2}{\sigma_0^2} \sim \chi^2(n{-}1)\) 两尾

两总体:均值差用两样本 t 检验(方差相等时合并方差,自由度 \(n_1{+}n_2{-}2\));方差比用 F 检验 \(F = S_1^2/S_2^2\)先 F 后 t:均值比较前先检验方差是否可视为相等);成对数据用配对 t(对差值做单样本 t——每对共享的个体差异被差分消掉,功效更高;实验设计能配对就配对)。

单侧检验:\(H_1: \mu > \mu_0\) 时拒绝域改单尾 \(T > t_\alpha\)——单双侧由问题立场决定,必须在看数据前定好(看完数据再选单侧是作弊)。

检验 ↔ 置信区间的对偶:水平 \(\alpha\) 的双侧检验不拒绝 \(H_0: \theta = \theta_0\) \(\iff\) \(\theta_0\) 落在 \(1-\alpha\) 置信区间内——两套工具一枚硬币,统计 III 的表反过来就是本页的表。

大样本与比例:CLT 兜底照旧;比例检验 \(Z = \frac{\hat p - p_0}{\sqrt{p_0(1-p_0)/n}}\)——A/B 实验的标准统计量。

4. 分布检验一瞥

χ² 拟合优度检验(数据是否服从某分布):分 \(k\) 组,比较观测频数 \(O_i\) 与理论频数 \(E_i\)

\[ \chi^2 = \sum_{i=1}^{k}\frac{(O_i - E_i)^2}{E_i} \;\overset{H_0}{\sim}\; \chi^2(k - 1 - \text{估计的参数个数}) \]

(要求各组 \(E_i \geq 5\),不足则并组。)列联表独立性检验同型(自由度 \((r-1)(c-1)\))。正态性检验实务另有 Shapiro–Wilk / QQ 图,知其名。

5. 典型例题

例 1(t 检验全流程) 灯泡寿命标称 \(\mu_0 = 1000\)h,抽 \(n = 16\)\(\bar X = 970,\ S = 60\)。在 \(\alpha = 0.05\) 下能否认为寿命不达标(\(H_1: \mu < 1000\),单侧)? \(T = \frac{970 - 1000}{60/4} = -2.0\);临界 \(-t_{0.05}(15) = -1.753\)\(T < -1.753\) 落入拒绝域 ⇒ 拒绝 \(H_0\),认为不达标(\(p \approx 0.032\))。

例 2(先 F 后 t) 两工艺样本 \(n_1 = n_2 = 10\)\(S_1^2 = 0.34, S_2^2 = 0.29\)\(F = 1.17 < F_{0.025}(9,9) = 4.03\) ⇒ 方差无显著差异,可用合并方差 t 检验比较均值。

例 3(A/B 实验) 新旧页面转化率 \(\hat p_A = 0.062\ (n{=}5000)\)\(\hat p_B = 0.055\ (n{=}5000)\):合并 \(\hat p = 0.0585\)\(Z = \frac{0.007}{\sqrt{0.0585 \times 0.9415 \times \frac{2}{5000}}} \approx 1.49\)\(p \approx 0.14 > 0.05\)——提升 0.7 个百分点尚不显著,别急着上线庆功;要么加大样本,要么接受"证据不足"。(🔗 ai 课 10 讲私人测试集比模型、你的预测层复盘判断"命中是运气还是实力",都是本页框架的应用场。)\(\blacksquare\)


最后一页:从"比较"走向"建模"——线性回归与方差分析,统计与机器学习的正式接壤处。