概率 II · 随机变量与分布
随机变量把"随机结果"翻译成"数",从此微积分全套工具进场。本页两件事:分布的描述工具(分布函数/分布列/密度),以及常见分布全家福——每个分布都记三件事:它建模什么场景、参数含义、期望方差。
1. 随机变量与分布函数
定义 随机变量 \(X: \Omega \to \mathbb{R}\)(可测函数——每个事件 \(\{X \leq x\}\) 都在事件域内)。
分布函数 \(F(x) = P(X \leq x)\)。特征性质(是分布函数 \(\iff\) 三条全满足):单调不减;右连续;\(F(-\infty) = 0, F(+\infty) = 1\)。区间概率 \(P(a < X \leq b) = F(b) - F(a)\);单点概率 \(P(X = a) = F(a) - F(a^-)\)(跳跃高度,连续分布处处为零——连续型单点概率为 0 但不代表不可能)。
2. 离散型:分布列与四大分布
\(P(X = x_k) = p_k\),\(\sum p_k = 1\)。
| 分布 | 分布列 | 场景 | \(E\) | \(D\) |
|---|---|---|---|---|
| 0–1 分布 \(B(1,p)\) | \(P(X{=}1){=}p\) | 单次成败 | \(p\) | \(p(1-p)\) |
| 二项 \(B(n,p)\) | \(\binom{n}{k}p^k q^{n-k}\) | \(n\) 重独立试验成功数 | \(np\) | \(npq\) |
| 泊松 \(P(\lambda)\) | \(\dfrac{\lambda^k}{k!}e^{-\lambda}\) | 单位时间稀有事件数 | \(\lambda\) | \(\lambda\) |
| 几何 \(G(p)\) | \(q^{k-1}p\) | 首次成功所需次数 | \(\frac1p\) | \(\frac{q}{p^2}\) |
| 超几何 | \(\frac{\binom{M}{k}\binom{N-M}{n-k}}{\binom{N}{n}}\) | 不放回抽样 | \(n\frac{M}{N}\) | — |
泊松定理(二项的极限):\(n \to \infty,\ np \to \lambda\) 时 \(B(n, p) \to P(\lambda)\)——"大量机会 × 微小概率 = 泊松",\(n \geq 100, np \leq 10\) 时近似可用。几何分布的无记忆性:\(P(X > m + n \mid X > m) = P(X > n)\)(离散唯一;"已经失败 m 次"不改变未来——赌徒谬误的数学反驳)。
3. 连续型:密度与四大分布
\(F(x) = \int_{-\infty}^x f(t)\,dt\);\(f \geq 0\),\(\int f = 1\);\(F' = f\)(连续点处)。
| 分布 | 密度 | 场景 | \(E\) | \(D\) |
|---|---|---|---|---|
| 均匀 \(U(a,b)\) | \(\frac{1}{b-a}\) 于 \((a,b)\) | 等可能区间 | \(\frac{a+b}{2}\) | \(\frac{(b-a)^2}{12}\) |
| 指数 \(\mathrm{Exp}(\lambda)\) | \(\lambda e^{-\lambda x}\ (x>0)\) | 等待时间/寿命 | \(\frac1\lambda\) | \(\frac{1}{\lambda^2}\) |
| 正态 \(N(\mu, \sigma^2)\) | \(\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}\) | 大量因素叠加 | \(\mu\) | \(\sigma^2\) |
| Gamma / Beta | (形状族) | 等待 \(k\) 次事件 / \([0,1]\) 上的比例 | — | — |
指数分布的无记忆性(连续唯一):\(P(X > s + t \mid X > s) = P(X > t)\)——"用过的和新的一样",可靠性理论与排队论的基石(🔗 随机过程页 Poisson 过程的间隔)。
正态分布专栏(最重要的分布,单列):
- 密度归一化依赖 \(\int e^{-x^2}dx = \sqrt\pi\)(数分 VI 的高斯积分在此上岗);
- 标准化:\(X \sim N(\mu, \sigma^2) \Rightarrow \dfrac{X - \mu}{\sigma} \sim N(0, 1)\),一切正态概率查标准正态表 \(\Phi\):\(P(a < X \leq b) = \Phi(\frac{b-\mu}{\sigma}) - \Phi(\frac{a-\mu}{\sigma})\);
- 3σ 法则:落在 \(\mu \pm \sigma, 2\sigma, 3\sigma\) 内的概率约 \(68.3\%,\ 95.4\%,\ 99.7\%\);
- 线性变换保正态:\(aX + b \sim N(a\mu + b, a^2\sigma^2)\);
- 为什么无处不在——中心极限定理(概率 V)给出解释;🔗 高斯噪声贯穿扩散模型全线(comfy 课 02 讲的每一个 \(\epsilon\))。
4. 随机变量函数的分布
\(Y = g(X)\) 的分布:
- 离散:把 \(X\) 的取值代进 \(g\),同值合并概率;
- 连续通用法(分布函数法):\(F_Y(y) = P(g(X) \leq y)\) 化成关于 \(X\) 的区间概率,再求导。万能,优先掌握;
- 公式法(\(g\) 严格单调可导):
(导数因子 = 一维 Jacobi——变量替换的"密度守恒":\(|f_Y\,dy| = |f_X\,dx|\)。🔗 归一化流生成模型的核心公式就是它的多维版,行列式换成 Jacobi 行列式,数分 VI/V 呼应。)
必会两例:\(X \sim N(0,1) \Rightarrow Y = X^2 \sim \chi^2(1)\)(分布函数法,密度 \(\frac{1}{\sqrt{2\pi y}}e^{-y/2}\)——统计页三大分布的起点);\(F\) 连续严格增时 \(F(X) \sim U(0,1)\)(概率积分变换——一切随机数生成的原理:均匀数过 \(F^{-1}\) 得任意分布)。
5. 典型例题
例 1(正态概率) 某测量 \(X \sim N(10, 4)\),求 \(P(8 < X \leq 14)\)。 解:标准化 \(P(-1 < Z \leq 2) = \Phi(2) - \Phi(-1) = 0.9772 - (1 - 0.8413) = 0.8185\)。
例 2(泊松近似) 某书 500 页共 100 个错字,求某页至少 2 个错字的概率。 解:每页错字数近似 \(P(\lambda),\ \lambda = 0.2\):\(P(X \geq 2) = 1 - e^{-0.2}(1 + 0.2) \approx 0.0175\)。
例 3(函数分布,分布函数法全流程) \(X \sim U(0, 1)\),求 \(Y = -\frac{1}{\lambda}\ln X\) 的分布。 解:\(y > 0\) 时 \(F_Y(y) = P(-\frac1\lambda \ln X \leq y) = P(X \geq e^{-\lambda y}) = 1 - e^{-\lambda y}\)——指数分布。这正是"均匀数变指数数"的生成器公式(概率积分变换的实战版,Monte Carlo 模拟必备)。\(\blacksquare\)
下一页:多个随机变量同台——联合分布、独立性、卷积与二维正态。