本页目录

统计 V · 线性回归与方差分析

统计线收官页,也是本站与机器学习的正式接壤处:线性回归是“第一个机器学习模型”,而它在统计里是有完整推断配套(显著性、区间、诊断)的严谨工具——这套配套恰是纯 ML 视角容易缺失的部分。方差分析则把 t 检验推广到多组比较。

学习层:直线拟合之后,先问它漏掉了什么

1. 具体情境:练习时长和测验分数

你收集了一组学习平台记录:\(x\) 是每周练习时长,\(y\) 是测验分数。最小二乘线能描述样本中的平均趋势,但团队很快提出四个不同问题:

  1. 拟合值与观测值的差是什么,和模型中的潜在误差是不是同一个东西?
  2. 一个 \(x\) 很远的点为什么可能强烈拉动斜率,即使它没有特别大的竖直偏差?
  3. R² 很高是否就代表模型质量、外推可靠或预测可用?
  4. 观测关联能否直接解释成“多练习导致分数提高”?答案取决于随机化、混杂控制与识别假设,而不由回归表单独决定。

2. 先预测:先看诊断再看数字

揭示前先判断:残差、误差、杠杆和影响度各自测什么;弯曲关系会不会在 R² 很高时仍留下结构化残差;同方差、独立性、线性关系缺一项时,斜率的标准误与 t 推断能否原样使用。

实验提供三个固定数据情境:近似线性、弯曲关系和带可拖动高杠杆点的样本。提交四项预测后才显示散点、拟合线、残差图、R² 与 Cook 影响度账本。

3. 正式桥:投影给出拟合,诊断检查假设

以下固定设计包含截距,要求 \(n>2\) 且 \(S_{xx}=\sum_i(x_i-\bar x)^2>0\)。一元 OLS 解为

\[ \hat\beta_1=\frac{S_{xy}}{S_{xx}}, \qquad \hat\beta_0=\bar y-\hat\beta_1\bar x, \qquad \hat y_i=\hat\beta_0+\hat\beta_1x_i. \]

观测残差和潜在误差必须分栏:

\[ e_i=y_i-\hat y_i \quad\text{是可计算的残差,} \qquad \varepsilon_i=y_i-(\beta_0+\beta_1x_i) \quad\text{是模型中的潜在误差。} \]

含截距的 OLS 有平方和分解;当 \(\mathrm{SST}>0\) 时定义样本内拟合度为

\[ \mathrm{SST}=\mathrm{SSR}+\mathrm{SSE}, \qquad R^2=1-\frac{\mathrm{SSE}}{\mathrm{SST}}. \]

对第 \(i\) 个观测,杠杆的几何量是

\[ h_{ii}=\frac1n+\frac{(x_i-\bar x)^2}{S_{xx}}, \]

它只描述 \(x\) 位置;影响度还要结合残差大小。在 \(\widehat\sigma^2>0\) 且 \(h_{ii}<1\) 时,Cook 距离写成

\[ D_i=\frac{e_i^2}{2\,\widehat{\sigma}^2}\frac{h_{ii}}{(1-h_{ii})^2}, \qquad \widehat{\sigma}^2=\frac{\mathrm{SSE}}{n-2}. \]

常量响应使 \(\mathrm{SST}=0\),此时 \(R^2\) 的比值没有定义;完美拟合使误差尺度为零,Cook 距离也不能靠把 \(0/0\) 填成 \(0\) 来解释。杠杆为 \(1\) 时删除该点可能使设计秩亏,需单独检查。

4. 定理、假设与失败边界

  • 拟合不等于因果。OLS 可以描述条件均值或线性投影;因果解释还需要随机化或可辩护的识别、时间顺序与混杂控制。
  • 残差不等于误差。残差是用同一批数据估计参数后的可见差,彼此有约束;误差是生成机制中的潜变量,不能从一张残差图直接观测。
  • Gauss–Markov 的账本有条件。线性关系、零条件均值、独立或不相关、同方差让 OLS 在相应线性无偏类中有 BLUE 结论;异方差、依赖或非线性会改变标准误与解释。
  • 正态性不是 OLS 拟合的入场券。它主要给出小样本精确 t/F 推断;非正态时可考虑大样本稳健标准误、重抽样或设计匹配的方法。
  • 杠杆与影响不同。远离 \(\bar x\) 的点有高杠杆,但若正好落在拟合趋势上未必高影响;高杠杆加大残差才容易扭转斜率。
  • R² 不等于质量。R² 高不保证残差无结构、预测能外推、变量选择合理或因果命题成立;也不能用一个阈值替代诊断和任务损失。

5. 动手实验与静态后备

参数改变会同时更新 SVG 和表格;重置会重新隐藏所有结果。有限数据只展示某个样本的几何账本,不能证明线性、独立、同方差或因果机制。

JavaScript 失效时的静态 fallback:默认情境是弯曲关系。请把以下四句当作阅读顺序,而不是把 R² 当作结论:

账本 应读什么 失败时的信号
拟合 \(\hat y_i\) 是投影/描述,斜率是样本内线性趋势 外推超出观测范围,线性投影不再有相同含义
残差 \(e_i=y_i-\hat y_i\) 是可见的观测差 残差随 x 呈弧线、漏斗或成串,提示线性/同方差/独立性问题
杠杆 \(h_{ii}\) 主要由 x 是否远离 \(\bar x\) 决定 极端 x 可能让斜率对单点敏感
影响度 Cook D 同时结合残差和杠杆 高 R² 仍可能被一个点支配

观测数据中“练习时长与分数相关”不自动等于“增加练习造成分数提升”;需要随机化或明确的因果识别假设。R² 也不等于模型质量,应该把残差结构、预测任务、外推范围和影响点一起报告。

6. 迁移题:删掉一个点,删掉哪条保证?

  1. 若所有 \(x_i=3\),正规方程还能唯一给出截距与斜率吗?若所有 \(y_i=7\) 但 \(x_i\) 有变化,\(R^2\) 是否应写成 \(1\)?
  2. 已有含截距的 OLS 直线,再添加一个很远的 \(x_*\),但恰取 \(y_*=\hat\beta_0+\hat\beta_1x_*\)。斜率会改变吗?高杠杆为何不保证高影响?
  3. 对 \(X\sim U(0,10),Y=X^2\) 推出线性投影与残差形状,核对 \(R^2=15/16\)。
核对:秩、正规方程与一个可积算例
  1. 所有 \(x_i=3\) 时只识别 \(\beta_0+3\beta_1\),设计秩为 \(1\)。所有 \(y_i=7\) 时拟合常量 \(7\)、\(\mathrm{SST}=\mathrm{SSE}=0\),\(R^2=1-0/0\) 无定义;这与低但非零响应尺度不同。
  2. 新点在旧直线上残差为零,对两个正规方程新增贡献均为零,因此旧系数仍为扩充样本的唯一 OLS 解。该点可有很高杠杆,但删除它不改变系数,若误差尺度为正则 Cook 距离为零。影响的定义是删除后的拟合变化,见 NIST 回归诊断。
  3. \(EX=5\),\(EX^2=100/3\),\(EX^3=250\),\(EX^4=2000\);\(\operatorname{Var}(X)=25/3\),\(\operatorname{Cov}(X,X^2)=250/3\),所以直线为 \(10x-50/3\)。残差 \(x^2-10x+50/3\) 是 U 形;\(\operatorname{Var}(X^2)=8000/9\),解释方差为 \(10^2(25/3)=2500/3\),比值 \(15/16\)。

先修:最小二乘与投影、条件期望、区间;后续:线性系统的数值误差。

1. 一元线性回归

最小二乘拟合与残差

图 5.1最小二乘:选直线使各点到直线的竖直残差(红)平方和最小——回归的几何本质。

模型 \(Y_i = \beta_0 + \beta_1 x_i + \varepsilon_i\),\(x_i\) 为固定设计、\(S_{xx}>0\)、\(n>2\),\(\varepsilon_i\) i.i.d. \(N(0, \sigma^2)\) 且 \(\sigma>0\)。(理论出身:二维正态的条件期望是线性的——概率 III 性质 2;一般总体则视为对 \(E[Y\mid x]\) 的线性逼近——概率 IV“最佳预测”的可实现版。)

最小二乘估计(OLS):\(\min_{\beta_0,\beta_1}\sum(y_i - \beta_0 - \beta_1 x_i)^2\),求偏导置零(正规方程)解得

\[ \hat\beta_1 = \frac{\sum(x_i - \bar x)(y_i - \bar y)}{\sum(x_i - \bar x)^2} = \frac{S_{xy}}{S_{xx}}, \qquad \hat\beta_0 = \bar y - \hat\beta_1 \bar x \]

(斜率 = 样本协方差/样本方差;两样本标准差非零时恰为 \(r s_y/s_x\),总体线性投影系数则为 \(\rho\sigma_y/\sigma_x\)——与概率 III 二维正态条件期望的系数严丝合缝;回归线必过重心 \((\bar x, \bar y)\)。)正态误差下 OLS = MLE(统计 II 的对应再现)。

Gauss–Markov 定理(陈述):误差零均值、同方差、不相关时,OLS 是最佳线性无偏估计(BLUE)——线性无偏类里方差最小。(不需要正态性;正态时更强——在所有无偏估计里最优。)

2. 推断配套(统计版回归比 ML 版多出的部分)

方差估计:\(\hat\sigma^2 = \frac{\text{SSE}}{n-2}\)(残差平方和,自由度扣掉两个参数)。

斜率的检验与区间:\(\hat\beta_1 \sim N\big(\beta_1, \frac{\sigma^2}{S_{xx}}\big)\),代入 \(\hat\sigma\) 得

\[ T = \frac{\hat\beta_1 - \beta_1}{\hat\sigma/\sqrt{S_{xx}}} \sim t(n-2) \]

回归显著性检验 \(H_0: \beta_1 = 0\) 回答“条件均值中是否存在线性斜率”;它检验的是关联结构,不自动回答 x 对 y 是否有因果作用。置信区间照统计 III 的枢轴量套路;因果解释还需要时间顺序、无混杂或随机化等识别条件。

拟合优度:平方和分解 \(\text{SST} = \text{SSR} + \text{SSE}\)(总变差 = 回归解释 + 残差),

\[ R^2 = \frac{\text{SSR}}{\text{SST}} \in [0, 1] \]

(一元情形 \(R^2 = r^2\),相关系数的平方。)⚠️ \(R^2\) 高 ≠ 模型对:非线性关系可以有高 \(R^2\),画残差图(残差应无结构地散布)是不可省略的诊断步骤——Anscombe 四组数据(相同的 \(R^2\) 与回归线、完全不同的散点形态)是这条警告的传世插图。

预测的两种区间(宽度不同,语义不同):对 \(E[Y\mid x_0]\) 的置信区间窄;对单个新观测 \(Y_0\) 的预测区间宽(多加一份 \(\sigma^2\) 的个体噪声——概率 IV 方差分解的实战)。两者都在 \(x_0\) 远离 \(\bar x\) 时变宽——外推危险的定量表达。

3. 多元回归一瞥(矩阵语言,高代上岗)

\(Y = X\beta + \varepsilon\)(\(X\) 为 \(n \times p\) 设计矩阵)。当 \(\operatorname{rank}(X)=p\),即设计矩阵列满秩时,OLS 解唯一且为:

\[ \hat\beta = (X^\top X)^{-1} X^\top Y \]

——高代最小二乘/投影的原样复用:\(\hat Y = X\hat\beta\) 是 \(Y\) 向 \(X\) 列空间的正交投影。若 \(X\) 秩亏,\((X^\top X)^{-1}\) 不存在,某些系数组合不可识别;Moore--Penrose 伪逆可选出一个最小范数解,但“得到数值解”不等于各系数唯一。近似共线性则使估计方差爆炸,岭回归 \((X^\top X + \lambda I)^{-1}X^\top Y\) 用偏差换稳定性——ai 课 01 讲的公式在此认祖归宗(贝叶斯视角 = 高斯先验的 MAP,统计 II/概率 I 的对应)。

🔗 从这里向 ML 的分岔:统计关心 \(\hat\beta\) 的推断(哪些变量显著、区间多宽),ML 关心预测(测试集误差);变量多起来后正则化与交叉验证接管模型选择(ai 课 01 讲)——两个学科在同一个公式上分道扬镳,又在实践中殊途同归。

4. 单因素方差分析(ANOVA)

问题:\(k\) 组均值是否全相等(t 检验只能两组;多次两两 t 检验会引爆多重检验问题——统计 IV)。

精确 F 推断的模型:\(Y_{ij}=\mu_j+\varepsilon_{ij}\),所有误差独立且服从同一个 \(N(0,\sigma^2)\)、\(\sigma>0\)。组数 \(k\ge2\),每组 \(n_j\ge1\),总数 \(n=\sum_jn_j>k\)。组间不同方差、相关观测或非正态小样本不能无条件沿用下述精确 F 分布。模型参照 NIST 单因素 ANOVA。

思想:把总变差拆成组间(处理效应)与组内(随机噪声):

\[ \text{SST} = \underbrace{\sum_j n_j(\bar Y_{j} - \bar Y)^2}_{\text{SSA(组间)}} + \underbrace{\sum_j\sum_i (Y_{ij} - \bar Y_j)^2}_{\text{SSE(组内)}} \]

(概率 IV 全方差公式“组间 + 组内”的样本版。)\(H_0\)(各组均值相等)下

\[ F = \frac{\text{SSA}/(k-1)}{\text{SSE}/(n-k)} \sim F(k-1,\ n-k) \]

\(F\) 大 ⇒ 组间差异远超噪声水平 ⇒ 拒绝“全相等”。(进一步找“谁和谁不同”用多重比较法,知其名。)回归与 ANOVA 本是一家:把组别编码成哑变量,ANOVA 就是回归的特例——线性模型一统江湖。

5. 典型例题

例 1(回归全流程) 广告费 x 与销售额 y,\(n = 10\):\(S_{xx} = 90,\ S_{xy} = 225,\ \bar x = 5, \bar y = 20\),SSE \(= 27\)。 解:\(\hat\beta_1 = 2.5,\ \hat\beta_0 = 7.5\);\(\hat\sigma^2 = 27/8 = 3.375\);检验 \(H_0: \beta_1 = 0\):\(T = \frac{2.5}{\sqrt{3.375/90}} \approx 12.9 \gg t_{0.975}(8) = 2.306\)——回归极显著。采用下尾分位数记号 \(P(T\le t_p)=p\)。拟合线中广告费相差 1 单位对应销售额预测均值相差 2.5;观测关联本身不识别增加广告费的因果效果。

例 2(残差图的必要性) 取总体 \(X\sim U(0,10)\)、\(Y=X^2\),最佳线性投影有 \(R^2=\operatorname{Corr}(X,X^2)^2=15/16\approx0.94\)(有限样本随设计而变)——数字很漂亮,残差图却呈明显 U 形(先正后负再正)。结论:\(R^2\) 看“解释了多少”,残差图看“漏了什么”,二者缺一不可。

例 3(ANOVA 判型) 三种教学法各 8 人,算得 SSA \(= 84\),SSE \(= 168\)。\(F = \frac{84/2}{168/21} = 5.25 > F_{0.95}(2, 21) \approx 3.47\) ⇒ 教学法之间存在显著差异(至于哪两种之间——多重比较的活)。\(\blacksquare\)


下一步可沿数值线性代数检查求解稳定性,沿概率与统计课程检查模型假设,再在真实数据项目中练习残差和不确定度报告。