本页目录

渐近统计 III · 三大检验与 Wilks 定理

对标:van der Vaart AS §15–16 | 前置:as-01/02、本科统计 IV 本科已经接触精确二项、正态总体与大样本检验;本页把渐近推断组织为正则参数模型中的统一框架:似然比、Wald、得分(Rao)三大检验渐近等价、极限都是 χ²——这是统计软件中许多 χ² 近似的理论依据。收官附 Neyman–Pearson 引理(最优性的地基)与局部功效视角。

学习层:三把渐近尺在小样本和边界处为什么不再同票?

1. 具体谜题:p 值、alpha 和“长期拒绝率”不是同一个数

从最小的二项模型开始:观察 \(K\sim\operatorname{Bin}(n,p)\),检验 \(H_0:p=p_0\)。给定数据 \(K=k\) 后,p 值是在 \(H_0\) 及完整检验规则成立时,得到不弱于当前证据的尾概率;给定数据之前,研究者先选的 alpha 是规则的第一类错误容许水平。若真值是某个备择 \(p_1\),功效则是重复抽样下拒绝规则的概率。三者的量词不同,不能互换成“原假设为真的概率”。

2. 先预测:三道判断先锁住

  1. 小 \(n\) 的二项比例检验中,哪一种方法可以直接用有限二项分布校准,而不必把离散分布假装成正态?
  2. 若当前数据给出 \(p\text{-value}=0.03\)、预先规定 \(\alpha=0.05\),这是否表示拒绝 \(H_0\),并且还表示 \(P(H_0\mid\text{data})=0.03\)?
  3. 当 \(p_0=0\) 或事件极稀有时,增加 \(n\) 是否足以让内点 Wald/Score/Wilks 结论自动恢复?

揭示后的表格会把 exact finite-binomial 作为有限模型内的参照,把 Wald、Score、LR 的正态/χ²尾概率标为渐近近似。当前 \(n,k\) 的计算是有限数值证据;“\(n\to\infty\) 下收敛到某分布”才是定理层陈述。

3. 二项模型:先把四本账分栏

记 \(\hat p=k/n\)。在 \(0<p_0<1\) 的内点,三把渐近尺可写成

\[ Z_{\mathrm W}=\frac{\hat p-p_0}{\sqrt{\hat p(1-\hat p)/n}},\qquad Z_{\mathrm S}=\frac{\hat p-p_0}{\sqrt{p_0(1-p_0)/n}}, \]

以及带符号的似然比根

\[ Z_{\mathrm{LR}}=\operatorname{sgn}(\hat p-p_0)\sqrt{2\left[k\log\frac{\hat p}{p_0}+(n-k)\log\frac{1-\hat p}{1-p_0}\right]}. \]

在常规正则条件下,\(H_0\) 为真且 \(n\to\infty\) 时,三者的平方都趋于 \(\chi^2_1\),或者说它们的带符号根趋近标准正态。这里的“常规”不是装饰:参数在开集内、似然可微到需要的阶、Fisher 信息有限且非奇异、MLE 局部良定,且固定真参数是内点。即便真参数为内点,有限样本 MLE 仍可能落到边界,这正是实验需要单独标出的情形。有限 \(n\) 时,三把尺可以给出不同 p 值;渐近等价不等于逐点相等。

exact 二项检验则可以在给定的有限 \(n,p_0\) 下直接枚举

\[ p_{\mathrm{exact}}(k)=\sum_{j:\,\Pr_{p_0}(K=j)\leq\Pr_{p_0}(K=k)}\Pr_{p_0}(K=j), \]

这里采用按零假设概率从小到大纳入的 probability ordering;它不同于简单的等尾 central 构造。离散模型的“两侧”并非唯一,换一种 ordering 可能得到另一个精确构造。它是对当前有限模型的校准,不是说所有更复杂的模型都存在同样简单的精确尾概率。

4. 局部功效:把备择放到 \(1/\sqrt n\) 显微镜下

固定备择 \(p_1\ne p_0\) 时,正则检验的功效往往趋于 \(1\),因此比较方法要看

\[ p_n=p_0+\frac{h}{\sqrt n}. \]

在内点,Score 根的局部极限是均值为

\[ \frac{h}{\sqrt{p_0(1-p_0)}} \]

的正态变量;双侧水平 \(\alpha\) 的局部功效因此由两个正态尾部决定。LR、Wald、Score 在同一正则模型下共享这个一阶局部功效。实验下方同时列出 exact rejection region 在当前有限 \(n\) 的枚举功效(仅在 \(p_0+h/\sqrt n\in[0,1]\) 时定义,越界标为 NA,不截断参数),以及上式给出的渐近局部功效:两者接近是有限证据,不能倒过来证明定理。

5. 边界和稀有事件:假设不是调参建议

当 \(p_0=0\) 或 \(1\) 时,\(p_0(1-p_0)=0\),Score 的内点标准误直接退化;Wald 在 \(k=0\) 或 \(n\) 时还会把估计方差置零;LR 的常规 Wilks \(\chi^2_1\) 也不能无条件沿用。若 \(p_0\) 随 \(n\) 靠近边界,或者 \(np_0\) 只有常数级,稀有事件的泊松/边界渐近标度可能替代固定内点的正态标度。增加样本量只能改善一个正确指定的近似,不能把边界参数变成内点。

无 JavaScript 时的静态读法:默认内点设置为 \(n=40,p_0=0.5,k=25,\alpha=0.05\)。先按上式分别计算 exact、Wald、Score、LR;exact 用二项概率排序,三种渐近方法用正态尾概率。切换到 \(p_0=0.02,k=0\) 可看到 Wald 的端点退化与 exact 的离散保守性;切换到 \(p_0=0\) 时,Score/Wilks 的内点证书应标为未定义/不适用,而不是用一个漂亮的 χ² 数字填空。局部功效列比较 \(p_n=p_0+h/\sqrt n\) 下的有限枚举与渐近公式。

账本 它回答什么 模型内证据 不能越界成什么
exact finite-binomial 给定 \(n,p_0\),当前 \(k\) 在零分布下多极端 枚举 \(k=0,\ldots,n\) 的质量 不能自动替代任意模型的精确检验
Wald / Score / LR 用渐近标尺近似当前数据的尾概率 当前样本的有限统计量与 p 值 不能把有限相等宣称为渐近定理
alpha 看数据前规定的拒绝阈值 当前规则是否满足 \(p\le\alpha\) 不是 \(H_0\) 为真的概率
p-value 在 \(H_0\) 下至少同样极端的尾概率 当前数据对应的一个数 不是 \(P(H_0\mid\text{data})\)
local power 真值为 \(p_0+h/\sqrt n\) 时长期拒绝率 有限枚举与渐近曲线的比较 不是本次发现为真的概率

6. 定理假设与失败边界

  • Wilks / 三剑客等价:需要内点正则参数、可识别且可微的似然、非奇异信息以及合适的 MLE/局部二次展开。边界、不可识别参数、稀有事件、非光滑模型、强依赖和高维 \(p\) 与 \(n\) 同阶时必须另建理论。
  • exact 不是魔法:它依赖二项分布和已知的 \(p_0\);若有 nuisance 参数、过度离散、抽样设计改变或停止规则改变,枚举对象也要改变。离散检验常保守,exact 并不意味着功效最大。
  • alpha 与 p 值:alpha 是设计层的拒绝规则,p 值是数据层的尾概率。只有先固定同一统计量、侧别和模型,才可用 \(p\le\alpha\) 做该规则下的决定。
  • 局部功效:\(h/\sqrt n\) 是固定内点 LAN 标度;它不是稀有事件边界的通用缩放。图上的有限差异是诊断与比较,不是收敛速度的证明。
  • 有限探针:调节 \(n,k,p_0,h\) 只展示有限个算例;任何“渐近成立/失败”的结论都仍需回到量词、正则条件和对应证明。

先修回链:收敛工具、MLE 相合性与渐近正态。

1. Neyman–Pearson 引理(检验最优性的原点)

定理(N–P) 简单假设 \(H_0:f_0\) vs \(H_1:f_1\):给定水平 \(\alpha\) 下功效最大的检验是似然比检验。一般写成拒绝函数

\[ \varphi^*(x)=\mathbf1\{f_1/f_0>k\}+\gamma\mathbf1\{f_1/f_0=k\},\qquad0\le\gamma\le1, \]

其中 \(k,\gamma\) 选到 \(E_0\varphi^*=\alpha\)(若能做到)。似然比在 \(f_0=0<f_1\) 处按 \(+\infty\) 处理并拒绝;两密度都为零的点对功效与水平没有影响。连续模型常有等号集零概率,可取 \(\gamma=0\);离散模型里若非随机阈值跨过 \(\alpha\),在等号层随机化才可能精确达到指定水平。 【证明】 设 \(\varphi^*\) 为 LR 检验、\(\varphi\) 任意水平 \(\leq\alpha\) 检验(取值 \([0,1]\) 的拒绝概率函数)。逐点非负性:\((\varphi^*(x) - \varphi(x))(f_1(x) - kf_0(x)) \geq 0\)(LR \(> k\) 处 \(\varphi^* = 1 \geq \varphi\);\(< k\) 处 \(\varphi^* = 0 \leq \varphi\))。积分展开:\(\int(\varphi^* - \varphi)f_1 \geq k\int(\varphi^* - \varphi)f_0 \geq 0\)(后者由水平条件)。即功效 \(\varphi^* \geq \varphi\)。\(\blacksquare\) 读法:证据的正确排序方式是似然比——三行证明立起整个检验理论的北极星;本科统计 IV 各检验的"合理性"都溯源于此(复合假设下推广为单调似然比/UMP 理论【引用】)。

2. 三大检验

先检验一个 \(d\) 维参数的完整点原假设 \(H_0:\theta=\theta_0\)。下表的 \(\ell\) 是总对数似然,\(I\) 是单观测信息阵,三种统计量衡量数据离这个点多远;此时自由度是 \(d\)。一般约束不能直接照抄此表,见表后的投影公式。

检验 统计量 直觉 需要拟合
似然比 LR \(2\big[\ell(\hat\theta) - \ell(\theta_0)\big]\) 峰顶比约束点高多少 两个模型
Wald \(n(\hat\theta - \theta_0)^\top I(\hat\theta)(\hat\theta - \theta_0)\) 估计离原点多远(按信息度量) 仅无约束
得分 Score \(n\,\bar\psi_n(\theta_0)^\top I(\theta_0)^{-1}\bar\psi_n(\theta_0)\) 约束点处的坡度多陡 仅约束下

这里 \(\bar\psi_n(\theta)=n^{-1}\sum_{i=1}^n\partial_\theta\log f(X_i;\theta)\) 是平均得分,\(I\) 是单个观测的信息阵;若改用总得分 \(U_n=n\bar\psi_n\),同一统计量写成 \(n^{-1}U_n^\top I^{-1}U_n\)。两种记号不能把 \(n\) 的位置混用。

若原假设是 \(r(\theta)=0\),设 \(R=Dr(\theta_0)\) 满行秩 \(q\),则自由度是独立约束的秩。LR 改成 \(2[\ell(\hat\theta)-\ell(\tilde\theta)]\),其中 \(\tilde\theta\) 是约束 MLE;Wald 改成

\[ n\,r(\hat\theta)^\top\left[Dr(\hat\theta)I(\hat\theta)^{-1}Dr(\hat\theta)^\top\right]^{-1}r(\hat\theta). \]

Score 也要在约束 MLE 处使用有效得分及对应信息,消去 nuisance 参数方向,不能继续把某个任意 \(\theta_0\) 填入点假设公式。约束可微且局部满秩、信息非奇异、两种 MLE 相合及局部二次展开,是这里引用约束版本的前提。

定理(Wilks + 三剑客等价) 正则条件下,\(H_0\) 真时三者都 \(\xrightarrow{d} \chi^2(q)\),且两两之差 \(= o_P(1)\)。 【骨架】(一维核心计算):对 \(\ell\) 在 \(\hat\theta\) 处二阶 Taylor(一阶项为零——MLE 是驻点):

\[ 2[\ell(\hat\theta) - \ell(\theta_0)] \approx n\,I(\theta_0)\,(\hat\theta - \theta_0)^2 \]

代入 as-02 主定理 \(\sqrt{nI}(\hat\theta - \theta_0) \xrightarrow{d} N(0,1)\) ⇒ 右端 \(\xrightarrow{d} \chi^2(1)\)——LR 与 Wald 在此展开中显式相等到 \(o_P(1)\);Score 用 \(\psi(\theta_0) \approx -\psi'(\cdot)(\hat\theta - \theta_0)\) 换算归队。多维/约束版沿约束流形分块投影,自由度 = 被约束的维数。\(\blacksquare\)

Wilks 的魔法与边界:在可识别、内点、信息非奇异等正则条件成立且 nuisance 参数处理满足相应理论时,极限 \(\chi^2(q)\) 的形状不依赖许多模型细节——logistic 回归删三个变量与正则生存模型删三个变量都可查 \(\chi^2(3)\)。自由度是关键输入,但绝不是唯一要核对的问题;边界、不可识别或奇异 nuisance 参数会改变极限分布。

实务分野(渐近等价 ≠ 有限样本等价):Wald 常便于从无约束拟合获得(单参数回归的 z 值平方即相应 Wald 统计量),但对非线性参数化敏感,小样本或边界附近可能失真;LR 对一一光滑重参数化不变,但有限样本校准也可能不准,不能据此断言总最稳或功效最大;Score 在"约束模型好算、全模型难算"时独占(诊断检验/拉格朗日乘子检验——计量的 LM 检验即它)。

3. 功效的渐近视角(一段话版)

在具备相合性所需的可识别性、估计与检验正则条件时,固定备择下三大检验功效通常 \(\to 1\)——比较功效必须让备择随 \(n\) 靠近:局部备择 \(\theta_n = \theta_0 + h/\sqrt n\) 下统计量 \(\xrightarrow{d}\) 非中心 χ²(点原假设的非中心参数为 \(h^\top I h\);一般约束则为 \((Rh)^\top(RI^{-1}R^\top)^{-1}(Rh)\),只计算偏离约束流形的方向)——功效由 \(I\) 度量的"距离"决定,三大检验局部功效也等价;这套"\(1/\sqrt n\) 邻域内看清一切"的显微镜(Le Cam 局部渐近正态理论 LAN【引用】)是渐近统计的深水区门牌——其核心对象(对数似然比过程)与 sc-04 Girsanov 的似然比是同一族。

4. 渐近统计三页资产盘点

CMT/Slutsky/Delta(语法)→ M-估计三段论 + "曲率之逆 × 得分噪声"(MLE 主定理)→ N–P 排序原理 + 三剑客 χ²(检验)。在本页正则条件内,三页组成参数推断的基本链条;界外(高维 \(p \sim n\)、非光滑、误设)各有下游学科接管(hdp 线、稳健统计、slt 线)。

5. 练习与要点

例 1(三剑客亲算) 泊松 \(H_0:\lambda=1\),观测 \(\bar X=1.2,n=100\):Wald \(=n(\bar X-1)^2/\bar X=3.33\);Score \(=n(\bar X-1)^2/1=4.0\);

\[ \mathrm{LR}=2n[\bar X\ln\bar X-\bar X+1] =200[1.2\ln(1.2)-0.2]\approx3.757. \]

三者相近(等价的体现)但不等(有限样本的分野),都对照 \(\chi^2(1)_{0.05}\approx3.841\):Score 拒绝、Wald 与 LR 不拒绝。边缘案例三剑客可以投出不同票,报告时说明用了哪把剑是学术诚实的一部分。

例 2(Wilks 实战:嵌套模型比较) 回归模型删 3 个变量:\(2(\ell_{\text{全}} - \ell_{\text{删}})\) 对照 \(\chi^2(3)\)——变量选择的 LR 检验流水线。具体说,\(\mathrm{AIC}_{\rm 删}-\mathrm{AIC}_{\rm 全}=\mathrm{LR}-2q\);这是两个模型的 AIC 差,不是 AIC 绝对值,也不是按 \(\alpha\) 校准的检验。

例 3(Wald 的参数化陷阱) 检验 \(\theta = 1\) 与检验 \(\ln\theta = 0\) 的 Wald 统计量不同(Delta 缩放不抵消),LR 则完全相同——"换个参数化结论翻转"是 Wald 的原罪;报告时说明参数化和校准方法,再用另一种方法诊断有限样本敏感性。\(\blacksquare\)

独立迁移:别让一个 p 值代替整条推理

  1. \(n=4,p_0=1/4,k=2\):按概率排序算 exact 两侧 p 值,并与“双倍较小单尾”比较。在 \(\alpha=0.05\) 下,该 exact 规则实际第一类错误率是多少?
  2. \(p_0=0.9,n=10,h=1\) 时,\(p_n=p_0+h/\sqrt n\) 能否用作当前二项备择?需要多大的 \(n\) 才落在 \([0,1]\)?
  3. 二维信息阵为 \(I_2\),原假设只约束 \(\theta_1=0\)。局部方向为 \(h=(0,3)\) 或 \((2,3)\),各自的自由度和非中心参数是多少?
核对独立迁移与判分要点

零分布五个质量以 256 为分母,依次为 \(81,108,54,12,1\)。观察 \(k=2\) 的概率排序纳入 \(k=2,3,4\),得 \(67/256\approx0.261719\);双倍较小单尾是 \(134/256\approx0.523438\),并非同一“两侧”定义。在 \(\alpha=0.05\) 下拒绝集合为 \(\{4\}\),所以实际第一类错误率只有 \(1/256\approx0.003906\);“精确”表示有限模型内有效,不表示实际水平恰等于 0.05。

第二题当前备择约为 \(1.2162\),不是概率。条件 \(0.9+1/\sqrt n\le1\) 给 \(n\ge100\);若要求仍为内点则 \(n>100\)。不能把它悄悄截成 1 后仍称原来的局部备择。实验据此把当前有限功效标为 NA;固定内点下 \(n\to\infty\) 的渐近公式仍有意义,二者的量词不同。

第三题 \(R=(1,0)\),自由度为 1。两个方向的非中心参数分别为 \(0\) 和 \(4\),不是 \(9\) 与 \(13\);\(\theta_2\) 沿原假设内部移动,不能把这一 nuisance 方向的变化也算成违背原假设的证据。

实验实现使用对数概率比较并仅给相等概率的舍入误差留裕量,不加固定的概率地板;极小 p 值用科学计数显示。概率排序与等尾方法的区别可对照 R 的二项检验实现;软件规则需连同采用的侧别与版本一起记录。


下一门:统计学习理论——把"检验一个假设"换成"从假设类里学一个假设",PAC/VC/Rademacher 三部曲。