本页目录
最优传输 II · 分布怎样走最短路,又怎样取平均
前置:耦合与最优性证书、测度与期望、凸共轭、正定矩阵与矩阵函数。 本课问题:已经知道怎样配对两份质量,怎样把配对变成一条分布路径?为什么直线运动未必最短?分布的平均又应该平均什么?
学习层:同样的端点,可以画出不同的中间分布
让粒子走直线,还漏了一次选择
源和目标都在−1、1各放一半质量。让每个粒子留在原位,总成本为零;把两份质量互换,每个粒子也走直线,却在中点全部挤到0,再重新分开。两端分布完全相同,中间分布却变了。直线只是选定配对后的运动方式,配对本身还得最优。
再看一个必须拆分的例子:源为位置0的一单位质量,目标在−2和2分别需要0.35和0.65。最优配对拆成两段。半程时,位移分布在−1和1;直接混合端点则仍在−2、0、2。两种插值都守恒,但在分布空间里走的路不同。
| 实验 | 修改什么 | 核对什么 |
|---|---|---|
| 一维位移与混合 | 原子质量、位置、两个时刻 | 全部分位数段、实际距离、均值与方差 |
| 三分布重心 | 三份分布、权重、候选平均 | 每份距离成本与精确目标差恒等式 |
| 二维两点配对 | 两组平面坐标、直接或交叉配对 | 两种成本、不同中间路径、是否最短 |
| 二维高斯 | 均值、源与目标协方差 | 完整映射矩阵、推前残差与协方差路径 |
先预测,再打开计算结果
- 粒子沿直线走,是否已经保证分布路径最短?
- 一维平方Wasserstein重心,平均的是分位数还是每个位置的概率?
- Brenier定理的绝对连续条件约束源还是目标?
- 高斯协方差沿最短路是否等于两端协方差的算术平均?
无 JavaScript 时:下面的固定图、参考值和第11节四道完整答案仍可阅读。下载记录保留固定输入下的全部分位数段、时间表、成本和矩阵。
固定运行:2026-09-11,Node 24.14.0 / darwin arm64。下载全部分位数、时间、成本和矩阵记录。一维源δ0,目标−2与2处质量0.35与0.65;三分布δ0、δ2、δ4,权重0.25、0.25、0.5,候选δ2;二维两端均(−1,0)、(1,0)各半,选交叉配对;高斯均值均0,源协方差diag(1,4),目标diag(4,1)。比较时刻s=0.25,当前t=0.5。
| 固定参数下的量 | 参考值 |
|---|---|
| 拆分端点W2平方 | 4 |
| 拆分端点W2 | 2 |
| 拆分1/4至1/2的W2平方 | 0.25 |
| 位移半程均值 | 0.3 |
| 位移半程方差 | 0.91 |
| 混合半程方差 | 1.91 |
| 三个点质量最优目标 | 2.75 |
| 候选点2的目标 | 3 |
| 候选与最优目标差 | 0.25 |
| 重心点位置 | 2.5 |
| 相同二维端点W2平方 | 0 |
| 交叉粒子配对成本 | 4 |
| 错误中点到源W2平方 | 1 |
| 错误路径1/4至1/2的W2平方 | 0.25 |
| 对角高斯W2平方 | 2 |
| 高斯映射第一方向缩放 | 2 |
| 高斯半程第一方向方差 | 2.25 |
| 高斯半程第二方向方差 | 2.25 |
原子质量与成本以精确分数为准;高斯矩阵和平方根为浮点近似,误差诊断不是严格区间证书。图线连接读数只辅助观察,重合曲线会覆盖。直线粒子运动仍须核对配对最优性;混合与位移的均值可相同而方差不同。
原子实验保留精确分数:每份质量与重心权重必须分别精确合计为1,不自动归一化;仅合并真正相同的位置,不用容差吞掉小质量。输入最多六位小数,每份一维分布最多四个原子。二维离散实验限定两点等权与两种置换配对。
高斯实验用浮点矩阵平方根,误差诊断不等于严格区间证书。源协方差要求正定,且行列式除以迹至少为0.0001;这是本实验控制数值条件的限制,不是Brenier定理的额外假设。目标允许半正定,包括线或点。椭圆表示协方差的一层等值轮廓,不是分布支持,也不是抽样结果。
1. 为什么平方成本开方以后才是距离
在欧氏空间中,记有限二阶矩概率测度集合为
乘积耦合的成本有限,因为 \(|x-y|^2\leq2|x|^2+2|y|^2\)。最优耦合存在,可用固定边缘的紧性与非负下半连续成本的下半连续性证明。非负性与对称性直接成立;成本为零的最优耦合集中在 \(x=y\),因此两边缘相同。
三角不等式需要把两份耦合接起来。若 \((X,Y)\) 耦合 \(\mu,\nu\),\((Y,Z)\) 耦合 \(\nu,\eta\),可以在给定 \(Y=y\) 时分别按两份条件分布生成 \(X,Z\),得到一个共同的三元联合分布。这是粘合引理;在欧氏空间上正则条件分布存在。取两端最优配对,再用 \(L^2\) 的Minkowski不等式:
开方使二次平均成本变成范数,正是三角不等式成立的关键。平方本身不是距离:三个点质量 \(\delta_0,\delta_1,\delta_2\) 的平方成本分别是1、1、4,不能要求 \(4\leq1+1\)。
2. 分布看起来接近,为何搬运成本仍不小
在 \(\mathcal P_2(\mathbb R^d)\) 中,准确的收敛条件是
前一个条件控制有界连续观察量,后一个条件阻止少量质量带着巨大二次成本逃向远方。定理见 Santambrogio导论,定理2.2。
例如取整数 \(n\geq1\),
对任意有界连续函数,远处那一项的权重趋于零,所以 \(\mu_n\Rightarrow\delta_0\)。但唯一运往0的计划仍付出 \(n^{-2}n^2=1\),故 \(W_2(\mu_n,\delta_0)=1\)。看不见远处的小点,不代表可以把它删掉。
必要性也能看出机制:若最优耦合给出 \(\|X_n-X\|_{L^2}\to0\),则依概率收敛推出依分布收敛,反三角不等式给出 \(|\|X_n\|_2-\|X\|_2|\leq\|X_n-X\|_2\)。充分性需要控制尾部后再做紧区域上的耦合逼近;它不是仅由弱收敛的定义直接得到。
3. Brenier定理:凸梯度如何消除拆分
定理。 若 \(\mu,\nu\in\mathcal P_2(\mathbb R^d)\) 且 \(\mu\) 对Lebesgue测度绝对连续,则平方欧氏成本的最优耦合唯一,并且
其中 \(u\) 是适当的凸函数,梯度在 \(\mu\)-几乎处处定义。唯一的是映射的几乎处处等价类,并不宣称凸势在所有点上只有一种写法。整体成本乘以 \(1/2\) 不改变最优计划。
证明的主线可以拆成三个实质步骤。首先,平方成本的循环单调条件消去纯 \(x\)、纯 \(y\) 项,成为内积的循环单调条件。Rockafellar的凸分析定理把这样的集合放进某个凸函数的次微分图:最优计划集中在 \(y\in\partial u(x)\) 上。这一步用到一个外部结构定理,不能用“高维排序”四字代替。
其次,凸函数在其定义域内部局部Lipschitz,从而Lebesgue几乎处处可微;有效域的相关边界为Lebesgue零测集。源有密度使这些不可微点也具有零源质量,于是 \(\partial u(x)\) 几乎处处只有一个点。计划因此不能在一个典型源点拆分。
最后,若有两份最优计划,其平均仍最优,也必须集中在一个映射图上。两个不同目标在同一源点混合会违反这一性质,所以两映射源几乎处处相同。凸次微分与平方传输的联系可参阅 Santambrogio第1.4节及Brenier说明。
在对偶势可用的版本中,同一结论还可用Fenchel–Young等式读出。令半平方成本下的源势为 \(\varphi\),写 \(u(x)=|x|^2/2-\varphi(x)\),接触条件化为
这里的凸函数是 \(u\),不要把Kantorovich源势 \(\varphi\) 直接称作凸势。
4. 目标可以有原子,二维最优配对也可以不唯一
源有密度、目标有原子并不矛盾。例如 \(X\) 均匀分布于 \([-1,1]\),令 \(T(x)=-1\) 当 \(x\lt0\)、\(T(x)=1\) 当 \(x>0\)。它把两半区间送到两点,是凸函数 \(u(x)=|x|\) 的几乎处处梯度。反方向从一个点出发,确定映射无法生成两处正质量;条件的位置不能颠倒。
没有源绝对连续性时,既可能有映射,也可能有多份最优计划。取二维源为 \((-1,0),(1,0)\) 各一半,目标为 \((0,-1),(0,1)\) 各一半。四格平方成本全是2,两种置换都最优。
在时刻 \(t=1/2\),一种配对得到 \((-1/2,-1/2),(1/2,1/2)\);另一种得到 \((-1/2,1/2),(1/2,-1/2)\)。两条路径端点相同,中点不同,成本与速度却同样最优。两置换计划的凸组合还可拆分质量;实验枚举的是两种置换,不把它们当成全部最优耦合。
若每边都恰好两个等权原子,运输多面体是连接这两种置换的线段,目标是仿射函数,所以比较两个端点足以得到全局最优值。这是该实验能精确判定最优的理由。
5. 从最优耦合推出常速测地线
取任一最优耦合 \((X,Y)\sim\pi^*\),记 \(D=W_2(\mu_0,\mu_1)\),定义
用同一粒子标签耦合两个时刻,可以先证明上界:
为什么这里实际上取等?对于 \(0\leq s\leq t\leq1\),三角不等式与这三个上界给出
总和被夹成同一个数,各段也只能达到对应上界。因此
整个证明无需除以 \(D\),所以相同分布、零距离也包括在内。在欧氏空间中,平方Wasserstein常速测地线都可由最优耦合作这样的位移插值得到;若源有密度,最优计划唯一也给出路径唯一。完整表述见 Santambrogio定理3.2。
若用任意可行耦合 \(\pi\),同样只能得到 \(W_2(\mu_s^\pi,\mu_t^\pi)\leq|s-t|\sqrt{C(\pi)}\),其中 \(C(\pi)=\int|x-y|^2\,d\pi\)。当 \(C(\pi)>D^2\),上面的夹逼不再闭合。第11节给出具体反例。
6. 一维直线插值:对齐分位数,再重新计算距离
一维的量化坐标是广义分位数 \(Q_\mu(u)=F_\mu^{-1}(u)\)。在有限二阶矩条件下,上一课已经证明共同分位数是平方成本的最优配对,所以
两个非降函数的凸组合仍非降,于是位移路径的分位数就是
原子模型中,把每份质量排成概率区间,列出所有交叠段;每段的质量保持不变,位置按上式运动。端点或中间时刻出现真正相同的位置时,要把质量相加。这里的非降性保证后续距离计算仍使用同一量化顺序。
实验同时保留两份证据:从完整段表算粒子的二次位移;从得到的两个实际分布重新作分位数配对算 \(W_2^2\)。它们一致才是模型内的数值核对。时间表包含0到1的等距读数和你输入的两个时刻;曲线连接读数辅助观察,不是额外采样的概率分布。
7. 混合插值也守恒,却可能具有无穷路径长度
混合路径是 \(\widetilde\mu_t=(1-t)\mu_0+t\mu_1\)。它在概率测度的凸集合内作线性组合,保留端点的位置,改变各处质量;位移路径则沿耦合移动位置。两者的均值相同,但方差通常不同。
令 \(m_i=\mathbb EX_i\)、\(V_i=\operatorname{Var}(X_i)\)。混合的方差为
位移的方差还取决于配对中的交叉协方差:
(这条写法是一维标量版本)。不能仅凭均值运动相同就判为同一条分布路径。
最小例子 \(\mu_0=\delta_0,\mu_1=\delta_1\) 中,位移为 \(\delta_t\),而混合为 \((1-t)\delta_0+t\delta_1\)。两个混合时刻之间恰有 \(|t-s|\) 的质量需要走单位距离,因此
把时间分成 \(N\) 等段,距离和是 \(N\sqrt{1/N}=\sqrt N\),趋于无穷。混合曲线连续,却不是这套距离下的有限长度路径。这里是一个明确反例,不是说所有混合路径都无穷长;两端相同时它仍是常值。
8. 一维重心:一个精确的方差分解
给定 \(\mu_1,\ldots,\mu_k\in\mathcal P_2(\mathbb R)\) 与非负权重 \(\lambda_i\),合计为1,定义
令 \(\overline Q=\sum_i\lambda_iQ_i\)。它仍非降且属于 \(L^2(0,1)\),所以确实对应一份概率分布 \(\overline\mu\)。逐个 \(u\) 展开平方,并用 \(\sum_i\lambda_i(Q_i-\overline Q)=0\) 消掉交叉项:
积分得到完整证书:
所以一维重心唯一;零权重和原子分布都包括在这份直接证明里。实验允许提交另一份候选分布,并把目标差与右侧真实距离逐项核对。有关一维重心与多维问题的区别,可读 Agueh–Carlier第6.1节;该节以非原子映射描述,我们这里用分位数积分直接覆盖原子情形。
多维通常没有一条共同的量化顺序;选一个参考分布,把若干Brenier映射平均后推前,不会自动得到任意多维数据的Wasserstein重心。这里的精确方差恒等式有明确的一维适用范围。
9. 高斯映射:先证明协方差推前,再计算成本
令 \(\mu_i=N(m_i,\Sigma_i)\),源协方差 \(\Sigma_0\) 正定,目标协方差 \(\Sigma_1\) 半正定。设
\(A\) 对称半正定,因此 \(T\) 是凸二次函数 \(u(x)=\tfrac12x^\top Ax+(m_1-Am_0)\cdot x\) 的梯度。直接乘法验证
仿射变换保持高斯族,均值与协方差都已正确,故 \(T_\#\mu_0=\mu_1\)。它又是凸梯度,因而是最优映射。目标奇异不妨碍从有密度的源压到一条线或一个点;源奇异时这个含逆矩阵的写法不可直接使用。
令 \(X=m_0+Z\)、\(\mathbb EZZ^\top=\Sigma_0\)。展开位移能量得到
最后一步用 \(A\Sigma_0A=\Sigma_1\) 和 \(\operatorname{tr}(A\Sigma_0)=\operatorname{tr}B\)。这就是Gaussian/Bures平方Wasserstein公式,相关矩阵推导见 Bhatia、Jain、Lim第2–3节。实验以平方范数算非负成本,把容易相消的迹公式留作独立数值对照;相同输入协方差直接使用解析恒等映射,并保留通用公式的残差。
插值的均值与协方差为
它通常不是 \((1-t)\Sigma_0+t\Sigma_1\)。如果两矩阵不交换,不能把矩阵平方根的次序任意调换。对于一般非高斯分布,相同均值与协方差也不确定分布;把这套公式代入两份矩估计,不能称为原分布的真实 \(W_2\)。
10. 通向动态传输与梯度流的接口
一条粒子路径 \(X_t\) 可以转写为质量连续性方程。若速度可由位置函数 \(v_t\) 表示,对光滑紧支撑检验函数 \(f\),链式法则给出
一般耦合可能有多个粒子在同一位置,用条件平均速度 \(v_t(z)=\mathbb E[Y-X\mid X_t=z]\) 仍可得到弱形式,Jensen不等式给出速度场能量不超过粒子能量。动态公式进一步在所有满足连续性方程与端点约束的曲线上最小化:
这里取窄连续概率路径与平方可积的Borel速度,连续性方程按分布理解。Benamou–Brenier公式的这一测度版本见 Peyré动态传输讲义。它与粒子插值相关,但本课的有限时间表不是一般动态方程求解器。
对于足够光滑、严格为正且有适当衰减的密度,熵 \(\mathcal E(\rho)=\int\rho\log\rho\) 的形式变分导数是 \(1+\log\rho\)。取负梯度速度 \(v=-\nabla\log\rho\),连续性方程便成为 \(\partial_t\rho=\Delta\rho\)。这说明热方程与Wasserstein梯度流的联系;原子测度没有这样的密度,不能把对数密度与逐点梯度直接塞给它。
严谨理论通过变分时间步 \(\rho^{k+1}\in\arg\min_\rho\{\mathcal E(\rho)+W_2^2(\rho,\rho^k)/(2\tau)\}\) 等工具建立存在与收敛。此处是后续研究课程的入口;经典解正则性、离散格式收敛与数值误差仍需另证。
11. 四道完整练习:给路径和平均各写一份证书
练习一:拆分之后的半程,和混合有什么不同?
取 \(\mu_0=\delta_0\),\(\mu_1=0.35\delta_{-2}+0.65\delta_2\),求半程分布、两段距离与两种半程方差。
展开完整答案:质量相同,位置与方差不同
最优计划把0的质量分为0.35和0.65,平方成本为 \(0.35\cdot4+0.65\cdot4=4\),所以 \(D=2\)。位移半程是 \(0.35\delta_{-1}+0.65\delta_1\),到两个端点的距离均为1。
混合半程则为 \(0.175\delta_{-2}+0.5\delta_0+0.325\delta_2\)。从源到它的平方成本是2;把它送往目标也恰需把位于0的两部分补往两端,平方成本仍为2,故两段距离均为 \(\sqrt2\)。
两种半程均值都是0.3。位移的二阶矩为1、方差为0.91;混合二阶矩为2、方差为1.91。均值相同不代表分布相同,更不代表路径等长。
练习二:直线运动能把零距离走成来回路吗?
源和目标均为二维两点 \((-1,0),(1,0)\) 各一半,选择交叉配对。求端点最优成本、中点以及1/4和3/4时刻之间的距离。
展开完整答案:粒子标签走了,分布也可能回到原处
保持原位的配对成本为零,所以端点 \(W_2=0\)。交叉配对让每个粒子走长度2,所选计划成本为4;在半程时两点都到0,分布为 \(\delta_{(0,0)}\),显然不是常值路径。
在1/4和3/4时刻,实际分布都为 \((-1/2,0),(1/2,0)\) 各一半,故这两个时刻的 \(W_2=0\)。若坚持同一粒子标签配对,每个粒子却走了长度1,给出的二次成本上界为1。上界不是最优距离;把任意标签运动成本称为分布距离会在这里出错。
练习三:三个点质量的重心怎样验收?
对 \(\delta_0,\delta_2,\delta_4\) 取权重 \(1/4,1/4,1/2\),求重心,并比较候选 \(\delta_2\)。
展开完整答案:目标差等于到重心的平方距离
三份分位数分别恒为0、2、4,加权平均为 \(5/2\),所以重心是 \(\delta_{5/2}\)。最优目标为
候选 \(\delta_2\) 的目标为 \(\tfrac14\cdot4+\tfrac14\cdot0+\tfrac12\cdot4=3\),目标差为 \(1/4\),恰好等于 \(W_2^2(\delta_2,\delta_{5/2})\)。若把三个概率分布直接线性混合,得到的是三个位置的质量,并非这个最优平均。
练习四:高斯协方差平均在哪一步走错?
均值都为0,\(\Sigma_0=\operatorname{diag}(1,4)\)、\(\Sigma_1=\operatorname{diag}(4,1)\)。求最优映射、距离与半程协方差。
展开完整答案:平均标准差方向,而非直接平均方差
在共同对角基下,\(A=\operatorname{diag}(2,1/2)\),它是正定矩阵,且 \(A\Sigma_0A=\Sigma_1\)。零均值的平方成本为
半程 \(M_{1/2}=\operatorname{diag}(3/2,3/4)\),所以 \(\Sigma_{1/2}=\operatorname{diag}(9/4,9/4)\)。直接平均协方差却得到 \(\operatorname{diag}(5/2,5/2)\)。这个逐坐标标准差的读法依赖共同对角化;非交换矩阵要保留完整平方根与矩阵乘法次序。
12. 把几何带入研究,先分清误差来自哪里
这课建立了三个可以复用的判断:最短路需要最优耦合;一维重心来自共同分位数;高斯公式只对相应高斯模型给出完整距离。它们能用于形状插值、分布比较和变分模型,但不会自动保证任意生成算法训练稳定。
在数据问题中,经验分布与总体分布的差、耦合优化没做完的差、正则化改变目标的差,以及分布模型忽略高阶结构的差,是不同来源。统计速率还依赖维数、矩条件、风险是距离还是距离平方,不能只报一个“样本量开方”规则。
下一课:熵正则化与Sinkhorn会把这份几何转成可迭代的数值问题。接下来的首要检查仍是边缘与目标口径:平滑后的耦合可行了吗,计算的是运输成本还是含熵的目标,算法误差和正则化偏差分别多大?