本页目录

概率 IV · 数字特征与条件期望

分布是完整档案,数字特征是"体检报告摘要":期望定位、方差定散度、协方差定联动。本页的顶点是条件期望——它不只是一个数,而是一个随机变量,并且是"最佳预测"的数学化身:机器学习整个回归问题的理论答案在此写就。

学习层:一个数字能看见多长的尾巴?

1. 具体实例:同样的平均成绩,风险账能一样吗?

两家供应商交付时间的均值都为 \(1\) 天,方差也可能相同,但一家把波动均匀摊开,另一家大多数时候准时、偶尔极慢。只报均值和方差,能不能决定一次极端延迟的概率?再问得细一点:\(E[X^k]\)、\(E[(X-EX)^k]\) 和 \(M_X(t)=E[e^{tX}]\) 是三本什么不同的账?

下面的实验用均匀、指数、Pareto 和一对同均值同方差的离散分布来回答。它把当前阶数 \(k\)、MGF 探针 \(t\) 和尾阈值 \(a\) 同时放在台面上;图画的是事件概率与不等式上界,表格则记录矩的类型和存在域。

2. 先预测:先猜账本,再看曲线

提交实验前,先判断:

  1. 原点矩 \(E[X^k]\) 与中心矩 \(E[(X-EX)^k]\) 在均值不为零时会不会相同?二阶中心矩和方差是什么关系?
  2. Pareto 分布可以有有限均值和方差,是否因此自动拥有某个正邻域上的 MGF?
  3. 两个分布的均值和方差都相同,能否据此推出它们的分布或尾概率相同?
  4. Markov/Chebyshev 公式给出的数是精确概率,还是只在满足条件时保证“不超过”的上界?

3. 正式桥:三种矩与两条上界各管什么

令 \(\mu=EX\)。原点矩和中心矩分别是

\[ m_k=E[X^k], \qquad \mu_k=E[(X-\mu)^k], \qquad \operatorname{Var}(X)=\mu_2. \]

中心化会改变数值但没有丢掉关系;例如

\[ \mu_2=m_2-m_1^2, \qquad \mu_3=m_3-3m_1m_2+2m_1^3. \]

MGF 是

\[ M_X(t)=E[e^{tX}], \]

只在期望有限的 \(t\) 集合上定义。若包含 \(0\) 的某个开区间内 MGF 有限,则可逐阶求导并用 \(M_X^{(k)}(0)=E[X^k]\) 生成矩;“某几阶矩有限”不等于 MGF 在 \(0\) 附近存在。特征函数 \(E[e^{itX}]\) 则始终存在,是另一种更稳健的分布编码。

对非负 \(W\) 和 \(a>0\),Markov 给出

\[ P(W\ge a)\le\frac{EW}{a}. \]

对有有限方差的 \(X\),Chebyshev 给出

\[ P(|X-\mu|\ge a)\le\frac{\operatorname{Var}(X)}{a^2}. \]

关键推导只有一个点态比较:\(W\ge a\mathbf1_{\{W\ge a\}}\)。两边取期望并除以 \(a>0\) 就得到 Markov;再把非负变量取为 \((X-\mu)^2\)、阈值取 \(a^2\),就得到 Chebyshev。因此非负性和有限方差各有明确的用途。

它们都是上界而不是自动的等号;实验会把精确事件概率与上界画在一起,专门防止把“保证不超过”读成“实际就是”。

4. 可操作实验:揭示后同时审计矩、MGF 与尾部

默认使用 \(U(0,2)\)、\(k=2\)、\(t=0.5\)、\(a=1.5\)。先完成预测门;提交后可切换分布、同矩离散变体、矩阶数、MGF 探针和尾阈值。结果图的两块分别对应 Markov 事件和 Chebyshev 事件,表格会随每个控件同步重算。

JavaScript 失效时的静态 fallback: 对默认 \(X\sim U(0,2)\),\(EX=1\)、\(DX=1/3\),原点二阶矩为 \(4/3\),中心二阶矩为 \(1/3\),MGF 对所有实数 \(t\) 存在;在 \(a=1.5\) 时,\(P(X\ge a)=0.25\),Markov 上界为 \(1/1.5\),而 \(P(|X-1|\ge1.5)=0\),Chebyshev 上界为 \((1/3)/(1.5)^2\)。其他预设的边界如下:

预设 均值与方差 矩 / MGF 存在域 尾部提醒
\(U(0,2)\) \(1, 1/3\) 所有阶原点矩有限;MGF 对所有实数 \(t\) 存在 有界尾部最终为 0
\(\operatorname{Exp}(1)\) \(1, 1\) \(m_k=k!\);MGF 仅在 \(t<1\) 有限 \(P(X\ge a)=e^{-a}\)
Pareto\((1,2.5)\) \(5/3, 20/9\) \(k<2.5\) 时原点矩有限;MGF 没有包含 0 的正邻域 右尾多项式衰减,Markov/Chebyshev 仍只是上界
Rademacher 与稀疏尖峰 都是 \(0, 1\) 两者各阶矩都有限,但四阶矩分别为 \(1\) 与 \(5\) 同均值同方差仍可有不同尾部

Pareto 行中的“MGF 没有正邻域”不表示 \(M(0)\) 不存在;它表示任意 \(t>0\) 都会被重尾拖成无穷,不能把有限均值/方差当成 MGF 条件。两种同矩分布也不是同一个分布的两种写法,而是有限低阶摘要相同、完整分布不同的反例。

5. 定理与失败边界:摘要不是完整档案

  • 原点矩和中心矩不能混写。 均值不为零时 \(E[X^2]\) 不是方差;中心矩先减去总体均值,偏度和峰度也要注明采用哪种标准化约定。
  • MGF 有存在域。 只有在包含 \(0\) 的邻域内有限时,MGF 才能作为稳定的矩生成器;重尾分布可能有若干有限矩,却没有这样的 MGF。特征函数的存在不能反推 MGF 的存在。
  • 有限矩不唯一决定分布。 即便所有矩都有限,是否能由矩唯一决定分布还需要额外条件;在本页最直接的层面,均值和方差更不可能决定尾形状。
  • Markov 与 Chebyshev 是保证。 Markov 需要非负变量,Chebyshev 需要有限方差;二者给的是上界,松是正常代价,不能拿来当精确尾概率。
  • 尾部读数依赖事件。 \(P(X\ge a)\) 与 \(P(|X-\mu|\ge a)\) 不是同一个事件;实验把 Markov 的非负变量事件和 Chebyshev 的中心化事件分栏显示。

因此,看到一个“均值 ± 两倍标准差”的说法时,先查它是在报告矩、给出不等式保证,还是声称某个具体分布的精确概率。三者的逻辑强度不同。

6. 迁移题:低阶摘要何时失效?

  1. 对称两点分布 \(P(X=\pm1)=1/2\),与 \(P(Y=0)=4/5,\ P(Y=\pm\sqrt5)=1/10\) 有相同均值、方差吗?比较四阶矩与 \(a=1\) 的绝对尾概率,并核对 Markov。
  2. \(X\in\{-1,1\}\) 等概率,\(\varepsilon\) 与 \(X\) 独立、均值零、方差 \(4\),\(Y=2X+\varepsilon\)。求最佳均方预测与总方差,给出常量预测 \(0\) 多付出的误差。
  3. Cauchy 特征函数为 \(\varphi(t)=e^{-|t|}\)。它在零点能生成有限均值吗?“特征函数总存在”到底没有保证什么?
核对:直接列点质量,再用正交分解
  1. 两者均值 \(0\)、方差 \(1\);四阶矩分别 \(1\)、\((1/5)25=5\)。\(P(|X|\ge1)=1\),\(P(|Y|\ge1)=1/5\);\(E|Y|=\sqrt5/5\),因此 \(1/5\le\sqrt5/5\),不可能把尖峰的真实尾概率写成 \(1\)。在 \(a=\sqrt5\) 时尖峰尾概率仍为 \(1/5\),严格超过这个阈值才变成 \(0\)。
  2. \(E[Y\mid X]=2X\),最小 MSE 为 \(4\);总方差 \(4+\operatorname{Var}(2X)=8\)。常量预测的 MSE 为 \(8\),多出的 \(4\) 是丢掉已知 \(X\) 信息的代价。
  3. 左导数为 \(1\),右导数为 \(-1\),所以零点不可微,不能从导数读均值。该分布 \(E|X|=\infty\);对称主值 \(0\) 也不是可积期望。特征函数存在不保证矩存在或可微。

先修:随机变量、联合分布、Hilbert 投影;后续:极限定理、回归。

1. 数学期望

定义 离散 \(E X = \sum x_k p_k\)(要求绝对收敛——否则重排改变"平均",数分 IV 条件收敛的警钟);连续 \(EX = \int x f(x)\,dx\)。

LOTUS(函数期望,"无意识统计学家定律"):求 \(E[g(X)]\) 不必先求 \(g(X)\) 的分布:

\[ E[g(X)] = \int g(x) f_X(x)\,dx, \qquad E[g(X,Y)] = \iint g\, f(x,y)\,dx\,dy \]

性质:线性 \(E[aX + bY] = aEX + bEY\)(要求 \(X,Y\) 可积,不需要独立);\(X,Y\) 独立且可积 \(\Rightarrow E[XY] = EX \cdot EY\)(反之不真)。

一般不能把 \(E[g(X)]\) 换成 \(g(EX)\);仿射 \(g\) 保证相等,非线性也可能在特定分布下相等,例如常量 \(X\)。当 \(X\) 与 \(g(X)\) 可积、\(g\) 凸时,方向由 Jensen 不等式给出:\(E[g(X)] \geq g(EX)\)(数分 II 的 Jensen 在概率语言下的形态——🔗 KL 散度非负、ELBO 推导(comfy 课 02 讲)的那一步 \(\log E \geq E \log\) 正是它)。

2. 方差与矩

本节方差、协方差恒等式均假设相关随机变量有有限二阶矩。定义 \(DX = E[(X - EX)^2]\);计算公式 \(DX = E X^2 - (EX)^2\)(展开即得,实算首选)。标准差 \(\sigma = \sqrt{DX}\)。

性质:\(D(aX + b) = a^2 DX\)(平移不变、缩放平方);

\[ D(X \pm Y) = DX + DY \pm 2\,\mathrm{Cov}(X, Y) \qquad (X \perp Y \text{ 时 } D(X\pm Y) = DX + DY) \]

在 \(\sigma>0\) 时,标准化 \(X^* = \frac{X - EX}{\sigma}\):零均值单位方差(🔗 特征标准化、BatchNorm/LayerNorm 的原型操作)。矩:\(k\) 阶原点矩 \(E X^k\)、中心矩 \(E(X - EX)^k\)(三阶定偏度、四阶定峰度)。

3. 协方差与相关系数

定义 \(\mathrm{Cov}(X, Y) = E[(X - EX)(Y - EY)] = E[XY] - EX\,EY\);在 \(\sigma_X,\sigma_Y>0\) 时,相关系数 \(\rho = \dfrac{\mathrm{Cov}(X,Y)}{\sigma_X \sigma_Y}\)。

性质:\(|\rho| \leq 1\)(对随机变量内积 \(\langle X, Y\rangle = E[XY]\) 用 Cauchy–Schwarz——高代 VI 的不等式换个舞台重演);\(|\rho| = 1 \iff Y = aX + b\) 几乎处处成立,其中 \(a\ne0\)(\(\rho\) 只度量线性关系的强度)。

⚠️ 不相关(\(\rho = 0\))≠ 独立:\(X \sim U(-1,1),\ Y = X^2\)——完全函数依赖却不相关(对称抵消)。独立 ⇒ 不相关;联合二维正态是逆命题成立的一个充分条件,仅有两个正态边际仍不够(概率 III 性质 3)。

协方差矩阵 \(\Sigma = \big[\mathrm{Cov}(X_i, X_j)\big]\):对称、半正定(\(a^\top \Sigma a = D(a^\top X) \geq 0\)——一行证明,高代 VI 半正定判据的天然例子)。🔗 PCA 对 \(\Sigma\) 做谱分解(高代 VI §5);多维正态由 \((\boldsymbol\mu, \Sigma)\) 完全决定。

4. 条件期望(本页顶点)

在条件密度存在的情形,\(E[Y \mid X = x] = \int y\, f_{Y\mid X}(y \mid x)\,dy\) 是 \(x\) 的函数;把 \(x\) 换回 \(X\),得随机变量 \(E[Y \mid X]\)——"用 \(X\) 的信息对 \(Y\) 做的最优摘要"。

一般地,对 \(Y\in L^1\),\(Z=E[Y\mid X]\) 是可积且 \(\sigma(X)\) 可测的随机变量,满足 \(E[Z\mathbf1_A]=E[Y\mathbf1_A]\) 对每个 \(A\in\sigma(X)\) 成立;它只在几乎处处意义下唯一,不依赖条件密度是否存在。

定理(全期望公式 / 塔性质)

\[ E\big[E[Y \mid X]\big] = E[Y] \]

("分组平均再总平均 = 总平均"。全概率公式的期望版;分层/分阶段问题的主武器。)

定理(条件期望 = 最佳预测) 若 \(Y\in L^2\),在所有 \(g(X)\in L^2\) 中,均方误差的几乎处处唯一最优预测为

\[ E[Y \mid X] = \arg\min_{g}\; E\big[(Y - g(X))^2\big] \]

证明思路:对任意 \(g\),把 \(Y - g(X) = (Y - E[Y|X]) + (E[Y|X] - g(X))\) 展开,交叉项用塔性质归零(第一项对给定 \(X\) 均值为零),剩下 \(\text{MSE}(g) = E[(Y - E[Y|X])^2] + E[(E[Y|X] - g(X))^2]\),第二项取 \(g = E[Y|X]\) 时消失。\(\blacksquare\)

🔗 这就是 ai 课 01 讲"平方损失下贝叶斯最优预测是条件期望"的完整证明——回归问题的理论天花板;整个监督学习是在有限数据下逼近 \(E[Y\mid X]\)。方差分解(全方差公式):\(DY = E[D(Y|X)] + D(E[Y|X])\)——"组内方差 + 组间方差",方差分析(统计页)与 bias-variance 直觉的源头。

5. 母函数与特征函数

矩母函数 \(M_X(t) = E[e^{tX}]\);特征函数 \(\varphi_X(t) = E[e^{itX}]\)(恒存在,模 \(\leq 1\))。三大功能:

  1. 生成矩:若 \(E|X|^k<\infty\),则 \(\varphi^{(k)}(0) = i^k E X^k\);可积的 \(|X|^k\) 控制导数,允许在期望内逐阶求导;
  2. 唯一决定分布(反演公式)——"验明正身"的手段;
  3. 独立和 → 乘积:\(\varphi_{X+Y} = \varphi_X \varphi_Y\)——卷积(概率 III)在变换域变乘法(与 Fourier 变换同一机理,数分 IV),三大可加族一行验证,也是下一页 CLT 证明的引擎。

常用对照:\(N(\mu,\sigma^2)\) 的 \(\varphi(t) = e^{i\mu t - \sigma^2 t^2/2}\);\(P(\lambda)\) 的 \(\varphi(t) = e^{\lambda(e^{it}-1)}\)。

6. 典型例题

例 1(示性函数分解求期望) \(n\) 个人随机把帽子发回,求拿对帽子人数 \(X\) 的期望与方差。 解:\(X = \sum I_k\)(\(I_k\) = 第 \(k\) 人拿对)。\(E I_k = \frac1n \Rightarrow EX = 1\)(线性不需要独立!)。当 \(n\ge2\) 且 \(j\ne k\) 时,\(E[I_jI_k] = \frac{1}{n(n-1)}\),算得 \(DX = 1\);\(n=1\) 时 \(X=1\) 恒定,方差为 \(0\)。"拆成示性函数之和"是组合期望的万能钥匙。

例 2(塔性质 / Wald 型) 每天写卡片数 \(N \sim P(\lambda)\),每张独立以概率 \(p\) 优质,求日优质数 \(Y\) 期望。 解:\(E[Y\mid N] = Np\),塔性质 \(EY = p\,EN = \lambda p\)。(实际上 \(Y \sim P(\lambda p)\)——泊松稀疏化,随机过程页再会。)

例 3(相关系数) \(X \sim U(0, 2\pi)\),\(Y = \sin X,\ Z = \cos X\):\(E[YZ] = \frac{1}{2\pi}\int_0^{2\pi}\sin x\cos x\,dx = 0 = EY \cdot EZ\) ⇒ 不相关;但 \(Y^2 + Z^2 = 1\) 严格依赖——不相关 ≠ 独立的又一实锤。\(\blacksquare\)


最后一页:当随机变量成千上万地相加,确定性从随机中涌现——大数定律与中心极限定理。