本页目录

概率 III · 多维随机变量

两台传感器各自的直方图完全一样,能否说明它们记录的信息也一样?不能:直方图丢掉了“哪两个读数一起出现”。本页从这一缺失建立联合分布,再把它拆成边缘与条件分布,最后说明相关系数为什么只能读出一部分依赖。

学习层:知道 X 以后,Y 的可能性怎样变化?

1. 从成对记录开始

一次记录是一对数 \((X,Y)\)。联合分布回答“两者一起落入某个区域的概率”;边缘分布回答“忽略另一个读数以后,这个变量怎样分布”;条件分布回答“已经知道一个读数,再怎样预测另一个”。这里把读数缩放成无量纲变量,图上的密度不是某一个点的概率。

实验比较四个解析模型:矩形上的独立均匀分布、\(X\sim U(-1,1)\) 且 \(Y=X^2\) 的曲线分布、三角形上的密度 \(8xy\),以及标准二维正态。先判断,再打开图:

  1. 密度在允许区域内写成 \(g(x)h(y)\),是否已经足以证明独立?
  2. \(Y=X^2\) 的协方差为什么可以为零?观察 \(X\) 后,\(Y\) 还有随机性吗?
  3. 二维正态中 \(\rho=0\) 的结论,能否推广到只有两个正态边缘的模型?
  4. 两个边缘不变时,联合结构还可以怎样改变?

2. 操作:切片之后必须重新归一化

上图的红线固定 \(X=x\)。有联合密度时,沿红线读到的是 \(y\mapsto f(x,y)\);它的积分一般不是 1,而是 \(f_X(x)\)。除以这个积分,才得到条件密度。下图直接对比原先的边缘与条件结果;曲线模型没有二维密度,下图改画累积分布函数,保留点质量的跳跃。

JavaScript 不可用时: 默认 \(X\sim U(-1,1)\)、\(Y=X^2\),探针 \(x=0.5\)。此时 \(\operatorname{Cov}(X,Y)=0\),但 \(Y\mid X=0.5\) 是位于 \(0.25\) 的点质量。边缘 \(F_Y(y)=\sqrt y\)(\(0\le y\le1\));条件 CDF 在 \(0.25\) 处从 0 跳到 1。

模型 联合分布 条件分布与独立性
矩形 \(f=1/4\),\(-1<x,y<1\) \(Y\mid X=x\sim U(-1,1)\),独立
抛物线 \(Y=X^2\),\(X\sim U(-1,1)\);无二维密度 条件是点质量;不相关但不独立
三角形 \(f=8xy\mathbf1_{\{0<x<y<1\}}\) \(f_{Y\mid X}=2y/(1-x^2)\),\(x<y<1\);不独立
标准二维正态 \(\lvert\rho\rvert<1\);整个平面上有密度 \(N(\rho x,1-\rho^2)\);仅 \(\rho=0\) 时独立

揭示后依次做三件事:在矩形里移动探针,看条件曲线是否改变;在三角形里把探针向右移,看允许区间缩短后密度为何升高;在正态里改变 \(\rho\),确认两个边缘保持标准正态,而条件均值和方差会改变。

图中的绿色短段只表示条件均值加减一个标准差,不等于支持区间,也不是对任意分布都含 68% 概率的区间。正态图的有限视窗不截断模型本身;金色填充只标支持,颜色深浅不编码密度。这里使用解析曲线,没有从一批散点“证明独立”。

3. 读完应能解释

为什么二维密度需要对面积积分,而条件密度只对一个变量积分?为什么“边缘连续”不保证存在二维密度?为什么三角形例子即便公式看似可分,条件分布仍记得探针的位置?下面用同一个模型逐步算清。

1. 联合分布比联合密度更一般

任何实随机向量都有联合分布函数

\[ F(x,y)=P(X\le x,Y\le y). \]

它还原矩形概率,例如 \(P(a<X\le b,c<Y\le d)=F(b,d)-F(a,d)-F(b,c)+F(a,c)\)。边缘由极限取得:\(F_X(x)=\lim_{y\to\infty}F(x,y)\)。

若联合分布对二维 Lebesgue 面积测度绝对连续,才存在非负密度 \(f\),满足

\[ \iint_{\mathbb R^2} f(x,y)\,dx\,dy=1, \qquad P((X,Y)\in D)=\iint_D f(x,y)\,dx\,dy. \]

小矩形概率在密度连续处近似为 \(f(x,y)\Delta x\Delta y\)。密度可以超过 1;归一化约束的是积分。若变量带单位,联合密度的单位是 \((\text{X单位}\times\text{Y单位})^{-1}\)。

两个变量各自有密度,联合却未必有。 取 \(X\sim U(-1,1),Y=X^2\)。全部概率落在抛物线上,而抛物线的二维面积为零;任何普通二维密度对它积分都只能得零,不能得 1。另一方面,\(0\le y\le1\) 时

\[ F_Y(y)=P(-\sqrt y\le X\le\sqrt y)=\sqrt y, \quad f_Y(y)=\frac1{2\sqrt y}\quad(0<y<1). \]

这个一维密度在零附近无界,却可积;它与不存在二维密度并不矛盾。离散变量则使用联合概率质量 \(p_{ij}\),边缘化对应求和。

2. 边缘化是投影,条件化是切片后归一化

有联合密度时,Tonelli 定理允许对非负函数先沿一个方向积分:

\[ f_X(x)=\int_{\mathbb R}f(x,y)\,dy, \qquad f_Y(y)=\int_{\mathbb R}f(x,y)\,dx. \]

对 \(0<f_X(x)<\infty\) 的点,可以选取条件密度版本

\[ f_{Y\mid X}(y\mid x)=\frac{f(x,y)}{f_X(x)}, \qquad \int_{\mathbb R}f_{Y\mid X}(y\mid x)\,dy=1. \]

这不是拿 \(P(X=x)\) 作分母:连续变量的该事件概率为零。若密度足够规则,可从窄条带 \(x<X<x+\varepsilon\) 的条件概率取极限来理解;一般理论中条件分布只在 \(X\) 的分布下几乎处处唯一。在零概率的个别 \(x\) 上如何定义,不由联合分布唯一决定;\(f_X(x)=0\) 时不能直接套比值。抛物线例子可选自然版本 \(Y\mid X=x\sim\delta_{x^2}\),这里 \(\delta_a\) 指位于 \(a\) 的概率质量,不是普通密度函数。

完整算一遍三角形模型。 令

\[ f(x,y)=8xy\mathbf1_{\{0<x<y<1\}}. \]

先固定 \(x\),支持要求 \(x<y<1\),因此

\[ f_X(x)=\int_x^1 8xy\,dy=4x(1-x^2),\quad 0<x<1; \qquad \int_0^1 f_X(x)\,dx=1. \]

换方向则得到 \(f_Y(y)=\int_0^y8xy\,dx=4y^3\)(\(0<y<1\))。两个密度在各自区间外均为零。现在固定 \(x\) 并归一化:

\[ f_{Y\mid X}(y\mid x)=\frac{2y}{1-x^2}\mathbf1_{\{x<y<1\}}, \qquad \int_x^1\frac{2y}{1-x^2}\,dy=1. \]

例如 \(x=1/2\) 时,\(P(Y>3/4\mid X=1/2)=(1-9/16)/(1-1/4)=7/12\)。条件均值和方差可由积分计算:

\[ E[Y\mid X=x]=\frac{2(1+x+x^2)}{3(1+x)},\qquad \operatorname{Var}(Y\mid X=x)=\frac{(1-x)^2(x^2+4x+1)}{18(1+x)^2}. \]

后一个形式显式显示 \(x\to1^-\) 时方差趋零,也避免直接用两个接近的数相减。实验中探针停在 \(0.02\le x\le0.98\);公式定义域是 \(0<x<1\),不是这个界面范围。

条件密度的归一化与“切片成比例”的标准推导可参看 Berkeley 201A 讲义 §2.1–2.4。

3. 独立要求整个联合结构因子化

独立的定义是对任意 Borel 集 \(A,B\),\(P(X\in A,Y\in B)=P(X\in A)P(Y\in B)\);等价地,联合 CDF 在所有点满足 \(F(x,y)=F_X(x)F_Y(y)\)。存在联合密度时,等价于

\[ f(x,y)=f_X(x)f_Y(y)\quad\text{在整个平面上几乎处处成立}. \]

不能只在“联合密度非零的地方”核对。三角形模型的完整公式是 \(8xy\mathbf1_{\{0<x<y<1\}}\);指示函数把两个变量绑在一起。在正方形中 \(0<y<x<1\) 的区域,联合密度为零,而两个边缘密度的乘积为正,因子化明确失败。

若完整密度为 \(g(x)h(y)\),其中两个因子非负,则归一化后确实独立。“矩形支持”只是方便使用的充分判据:更一般的允许集合可为 \(A\times B\),无需是两个区间;边界和零测集差异不影响概率。仅仅支持为乘积集合也不够,密度仍可能不因子化。

有二阶矩时,独立推出 \(E[XY]=E[X]E[Y]\),所以协方差为零。反向不成立:抛物线模型由对称性给出 \(E[X]=E[X^3]=0\),故 \(\operatorname{Cov}(X,Y)=0\)。但事件 \(A=\{|X|<1/2\}\) 与 \(B=\{Y<1/4\}\) 相同,\(P(A\cap B)=1/2\ne(1/2)^2\),这直接否定独立。

相同边缘,不同联合:把 copula 写出来

设 \(U,V\) 各自均匀于 \((0,1)\)。独立时 \(C(u,v)=P(U\le u,V\le v)=uv\);令 \(V=U\),则 \(C(u,v)=\min(u,v)\);令 \(V=1-U\),则 \(C(u,v)=\max(u+v-1,0)\)。三个模型的边缘完全相同,联合却不同,后两个还集中在直线上。

copula 就是边缘均为标准均匀的联合 CDF。Sklar 定理写成

\[ F(x,y)=C(F_X(x),F_Y(y)). \]

根据 Sklar 定理,连续边缘时 \(C\) 唯一,可用分位数转换在原尺度与均匀尺度之间移动;有跳跃的边缘时,整个单位正方形上的 copula 一般不唯一,只在边缘 CDF 的值域乘积上被确定。它描述联合依赖,不能由两张边缘直方图恢复。高斯 copula 的具体性质可继续读 Meyer 的原始论文。

4. 二维正态:配方得到条件分布

先令 \(X,Z\) 独立且都为 \(N(0,1)\),定义 \(Y=\rho X+\sqrt{1-\rho^2}\,Z\),\(|\rho|<1\)。这个构造说明:\(X,Y\) 的边缘均为标准正态,协方差为 \(\rho\);已知 \(X=x\) 后,第一项变成确定数,第二项仍提供独立噪声。

由变量替换或配方可写出完整密度:

\[ f(x,y)=\frac1{2\pi\sqrt{1-\rho^2}} \exp\!\left[-\frac{x^2-2\rho xy+y^2}{2(1-\rho^2)}\right], \qquad \frac{x^2-2\rho xy+y^2}{1-\rho^2}=x^2+\frac{(y-\rho x)^2}{1-\rho^2}. \]

右边把 \(f\) 拆成 \(\phi(x)\) 与一个关于 \(y\) 的正态密度,直接得到

\[ Y\mid X=x\sim N(\rho x,1-\rho^2). \]
二维正态在x等于1的切片除以边缘密度后归一化,条件均值0.6方差0.64
图 3.1固定 ρ=0.6、x=1。左图的等比例轮廓与红色切片属于联合密度;右图分别显示边缘 φ(y)、原始切片 f(1,y) 和条件密度 f(1,y)/φ(1)。切片的全线积分为 φ(1)≈0.24197,条件密度积分为1,条件均值0.6、方差0.64。有限绘图窗口不是正态支持。

一般位置与尺度可由 \(X=\mu_X+\sigma_X X_0\)、\(Y=\mu_Y+\sigma_Y Y_0\) 恢复(\(\sigma_X,\sigma_Y>0\)):条件均值为 \(\mu_Y+\rho\sigma_Y(x-\mu_X)/\sigma_X\),条件方差为 \(\sigma_Y^2(1-\rho^2)\)。这与 Lancaster 的二维正态条件分布公式 一致。

这里有三个必须保留的边界:

5. 变量替换:和、最值与链式采样

求 \(W=X+Y\) 时,保留一个辅助变量 \(V=X\)。逆变换为 \((x,y)=(v,w-v)\),Jacobian 绝对值为 1,所以

\[ f_W(w)=\int_{\mathbb R}f(v,w-v)\,dv. \]

独立时才能进一步写为卷积 \(\int f_X(v)f_Y(w-v)\,dv\)。两个独立 \(U(0,1)\) 相加时,积分区间长度为

\[ f_W(w)=\begin{cases}w,&0<w\le1,\\2-w,&1<w<2,\\0,&\text{其他}.\end{cases} \]

一般可逆光滑变换 \(z=T(x)\) 在 Jacobian 非零的区域满足 \(f_Z(z)=f_X(T^{-1}z)|\det DT^{-1}(z)|\);多对一变换要把不同逆分支的贡献相加,不能遗漏负根。其积分基础见 多元积分与变量替换。

独立变量相加时,正态的均值与方差分别相加,泊松的强度相加;二项分布需有相同成功概率,Gamma 分布需有相同 rate(或一致 scale),才留在原分布族。独立 \(\chi^2\) 相加时自由度相加。

最值用事件相交更直接。相互独立的 \(X_i\) 满足

\[ P(\max_i X_i\le z)=\prod_iF_i(z),\quad P(\min_iX_i>z)=\prod_i(1-F_i(z)). \]

独立指数寿命 \(\mathrm{Exp}(\lambda_i)\) 的最小值因而为 \(\mathrm{Exp}(\sum_i\lambda_i)\);若存在共因失效,乘积公式不能直接使用。

最后,\(f(x,y)=f_X(x)f_{Y\mid X}(y\mid x)\) 提供“先采 \(X\),再条件采 \(Y\)”的机制。多步链式分解一般为 \(p(x_{0:T})=p(x_0)\prod_{t=1}^T p(x_t\mid x_{0:t-1})\);把每项简化成 \(p(x_t\mid x_{t-1})\) 还需要 Markov 条件,单靠链式法则不够。由此进入概率图模型或生成模型时,必须说清哪些条件独立是模型假设。

6. 迁移练习与答案

题 1:条件预测能还原整体平均吗?

对三角形模型,求 \(E[X],E[Y],E[XY]\) 与协方差。再用 \(E[E[Y\mid X]]\) 独立核对 \(E[Y]\)。

展开推导

由两个边缘积分,\(E[X]=\int_0^1 4x^2(1-x^2)\,dx=8/15\),\(E[Y]=\int_0^1 4y^4\,dy=4/5\)。直接在三角形积分给出

\[ E[XY]=\int_0^1\int_0^y8x^2y^2\,dx\,dy=\frac49, \quad \operatorname{Cov}(X,Y)=\frac49-\frac8{15}\frac45=\frac4{225}. \]

把条件均值乘回 \(f_X\),有 \(E[Y\mid X=x]f_X(x)=\frac83x(1-x^3)\),对 \(x\in(0,1)\) 积分得 \(\frac83(\frac12-\frac15)=4/5\)。这正是全期望公式:按各探针出现的概率加权,而不是把条件均值等权平均。

题 2:两两独立是否足够?

独立公平比特 \(A,B\in\{0,1\}\),令 \(C=A\oplus B\)(异或)。证明任意两个独立,三个却不相互独立。

展开推导

四种等概率记录是 \((0,0,0),(0,1,1),(1,0,1),(1,1,0)\)。任取两列,四种二元组合各出现一次,所以联合概率均为 \(1/4=(1/2)(1/2)\)。但 \(P(A=0,B=0,C=0)=1/4\),不等于三个边缘概率的乘积 \(1/8\)。因此多元独立是整个联合分布的因子化;逐对检查不能取代它。

题 3:没有相关,是否就没有可预测性?

比较两模型:①标准二维正态且 \(\rho=0\);②\(X\sim N(0,1)\)、\(Y=SX\),独立符号 \(S\) 各半。两者协方差都为零。已知 \(X=x\) 后,条件均值与方差各是什么?

展开推导

① 条件仍为 \(N(0,1)\),均值 0、方差 1。② 条件为 \(\frac12\delta_x+\frac12\delta_{-x}\),均值仍是 0,方差却是 \(x^2\);\(x=0\) 时两质量合成一个点。相同的线性预测没有展示这份信息:观察 \(X\) 已经完全确定 \(|Y|\)。本例也说明,仅比较条件均值是否变化,不能作为独立性的完整检验。


下一页:期望、方差、协方差与条件期望。联合结构决定我们能预测什么,条件期望则给出平方误差下的最佳预测。