本页目录

最优传输 II · 分布怎样走最短路,又怎样取平均

前置:耦合与最优性证书、测度与期望、凸共轭、正定矩阵与矩阵函数。 本课问题:已经知道怎样配对两份质量,怎样把配对变成一条分布路径?为什么直线运动未必最短?分布的平均又应该平均什么?

学习层:同样的端点,可以画出不同的中间分布

让粒子走直线,还漏了一次选择

源和目标都在−1、1各放一半质量。让每个粒子留在原位,总成本为零;把两份质量互换,每个粒子也走直线,却在中点全部挤到0,再重新分开。两端分布完全相同,中间分布却变了。直线只是选定配对后的运动方式,配对本身还得最优。

再看一个必须拆分的例子:源为位置0的一单位质量,目标在−2和2分别需要0.35和0.65。最优配对拆成两段。半程时,位移分布在−1和1;直接混合端点则仍在−2、0、2。两种插值都守恒,但在分布空间里走的路不同。

实验 修改什么 核对什么
一维位移与混合 原子质量、位置、两个时刻 全部分位数段、实际距离、均值与方差
三分布重心 三份分布、权重、候选平均 每份距离成本与精确目标差恒等式
二维两点配对 两组平面坐标、直接或交叉配对 两种成本、不同中间路径、是否最短
二维高斯 均值、源与目标协方差 完整映射矩阵、推前残差与协方差路径

先预测,再打开计算结果

  1. 粒子沿直线走,是否已经保证分布路径最短?
  2. 一维平方Wasserstein重心,平均的是分位数还是每个位置的概率?
  3. Brenier定理的绝对连续条件约束源还是目标?
  4. 高斯协方差沿最短路是否等于两端协方差的算术平均?

无 JavaScript 时:下面的固定图、参考值和第11节四道完整答案仍可阅读。下载记录保留固定输入下的全部分位数段、时间表、成本和矩阵。

分位数位移、重心、错误配对与高斯协方差

图1.1:固定输入的路径与重心账本;图线连接离散点只作读图辅助。可打开原图查看四个面板。

固定运行:2026-09-11,Node 24.14.0 / darwin arm64。下载全部分位数、时间、成本和矩阵记录。一维源δ0,目标−2与2处质量0.35与0.65;三分布δ0、δ2、δ4,权重0.25、0.25、0.5,候选δ2;二维两端均(−1,0)、(1,0)各半,选交叉配对;高斯均值均0,源协方差diag(1,4),目标diag(4,1)。比较时刻s=0.25,当前t=0.5。

固定参数下的量 参考值
拆分端点W2平方 4
拆分端点W2 2
拆分1/4至1/2的W2平方 0.25
位移半程均值 0.3
位移半程方差 0.91
混合半程方差 1.91
三个点质量最优目标 2.75
候选点2的目标 3
候选与最优目标差 0.25
重心点位置 2.5
相同二维端点W2平方 0
交叉粒子配对成本 4
错误中点到源W2平方 1
错误路径1/4至1/2的W2平方 0.25
对角高斯W2平方 2
高斯映射第一方向缩放 2
高斯半程第一方向方差 2.25
高斯半程第二方向方差 2.25

原子质量与成本以精确分数为准;高斯矩阵和平方根为浮点近似,误差诊断不是严格区间证书。图线连接读数只辅助观察,重合曲线会覆盖。直线粒子运动仍须核对配对最优性;混合与位移的均值可相同而方差不同。

原子实验保留精确分数:每份质量与重心权重必须分别精确合计为1,不自动归一化;仅合并真正相同的位置,不用容差吞掉小质量。输入最多六位小数,每份一维分布最多四个原子。二维离散实验限定两点等权与两种置换配对。

高斯实验用浮点矩阵平方根,误差诊断不等于严格区间证书。源协方差要求正定,且行列式除以迹至少为0.0001;这是本实验控制数值条件的限制,不是Brenier定理的额外假设。目标允许半正定,包括线或点。椭圆表示协方差的一层等值轮廓,不是分布支持,也不是抽样结果。

1. 为什么平方成本开方以后才是距离

在欧氏空间中,记有限二阶矩概率测度集合为

\[ \mathcal P_2(\mathbb R^d)=\left\{\mu:\mu(\mathbb R^d)=1,\quad \int |x|^2\,d\mu(x)\lt\infty\right\}, \qquad W_2^2(\mu,\nu)=\min_{\pi\in\Pi(\mu,\nu)}\int|x-y|^2\,d\pi. \]

乘积耦合的成本有限,因为 \(|x-y|^2\leq2|x|^2+2|y|^2\)。最优耦合存在,可用固定边缘的紧性与非负下半连续成本的下半连续性证明。非负性与对称性直接成立;成本为零的最优耦合集中在 \(x=y\),因此两边缘相同。

三角不等式需要把两份耦合接起来。若 \((X,Y)\) 耦合 \(\mu,\nu\),\((Y,Z)\) 耦合 \(\nu,\eta\),可以在给定 \(Y=y\) 时分别按两份条件分布生成 \(X,Z\),得到一个共同的三元联合分布。这是粘合引理;在欧氏空间上正则条件分布存在。取两端最优配对,再用 \(L^2\) 的Minkowski不等式:

\[ W_2(\mu,\eta) \leq\|X-Z\|_{L^2} \leq\|X-Y\|_{L^2}+\|Y-Z\|_{L^2} =W_2(\mu,\nu)+W_2(\nu,\eta). \]

开方使二次平均成本变成范数,正是三角不等式成立的关键。平方本身不是距离:三个点质量 \(\delta_0,\delta_1,\delta_2\) 的平方成本分别是1、1、4,不能要求 \(4\leq1+1\)。

2. 分布看起来接近,为何搬运成本仍不小

在 \(\mathcal P_2(\mathbb R^d)\) 中,准确的收敛条件是

\[ W_2(\mu_n,\mu)\to0 \quad\Longleftrightarrow\quad \mu_n\Rightarrow\mu\quad\text{且}\quad \int|x|^2\,d\mu_n\to\int|x|^2\,d\mu. \]

前一个条件控制有界连续观察量,后一个条件阻止少量质量带着巨大二次成本逃向远方。定理见 Santambrogio导论,定理2.2。

例如取整数 \(n\geq1\),

\[ \mu_n=(1-n^{-2})\delta_0+n^{-2}\delta_n. \]

对任意有界连续函数,远处那一项的权重趋于零,所以 \(\mu_n\Rightarrow\delta_0\)。但唯一运往0的计划仍付出 \(n^{-2}n^2=1\),故 \(W_2(\mu_n,\delta_0)=1\)。看不见远处的小点,不代表可以把它删掉。

必要性也能看出机制:若最优耦合给出 \(\|X_n-X\|_{L^2}\to0\),则依概率收敛推出依分布收敛,反三角不等式给出 \(|\|X_n\|_2-\|X\|_2|\leq\|X_n-X\|_2\)。充分性需要控制尾部后再做紧区域上的耦合逼近;它不是仅由弱收敛的定义直接得到。

3. Brenier定理:凸梯度如何消除拆分

定理。 若 \(\mu,\nu\in\mathcal P_2(\mathbb R^d)\) 且 \(\mu\) 对Lebesgue测度绝对连续,则平方欧氏成本的最优耦合唯一,并且

\[ \pi^*=(\mathrm{id},\nabla u)_\#\mu, \qquad (\nabla u)_\#\mu=\nu, \]

其中 \(u\) 是适当的凸函数,梯度在 \(\mu\)-几乎处处定义。唯一的是映射的几乎处处等价类,并不宣称凸势在所有点上只有一种写法。整体成本乘以 \(1/2\) 不改变最优计划。

证明的主线可以拆成三个实质步骤。首先,平方成本的循环单调条件消去纯 \(x\)、纯 \(y\) 项,成为内积的循环单调条件。Rockafellar的凸分析定理把这样的集合放进某个凸函数的次微分图:最优计划集中在 \(y\in\partial u(x)\) 上。这一步用到一个外部结构定理,不能用“高维排序”四字代替。

其次,凸函数在其定义域内部局部Lipschitz,从而Lebesgue几乎处处可微;有效域的相关边界为Lebesgue零测集。源有密度使这些不可微点也具有零源质量,于是 \(\partial u(x)\) 几乎处处只有一个点。计划因此不能在一个典型源点拆分。

最后,若有两份最优计划,其平均仍最优,也必须集中在一个映射图上。两个不同目标在同一源点混合会违反这一性质,所以两映射源几乎处处相同。凸次微分与平方传输的联系可参阅 Santambrogio第1.4节及Brenier说明。

在对偶势可用的版本中,同一结论还可用Fenchel–Young等式读出。令半平方成本下的源势为 \(\varphi\),写 \(u(x)=|x|^2/2-\varphi(x)\),接触条件化为

\[ u(x)+u^*(y)=x\cdot y \quad\Longleftrightarrow\quad y\in\partial u(x). \]

这里的凸函数是 \(u\),不要把Kantorovich源势 \(\varphi\) 直接称作凸势。

4. 目标可以有原子,二维最优配对也可以不唯一

源有密度、目标有原子并不矛盾。例如 \(X\) 均匀分布于 \([-1,1]\),令 \(T(x)=-1\) 当 \(x\lt0\)、\(T(x)=1\) 当 \(x>0\)。它把两半区间送到两点,是凸函数 \(u(x)=|x|\) 的几乎处处梯度。反方向从一个点出发,确定映射无法生成两处正质量;条件的位置不能颠倒。

没有源绝对连续性时,既可能有映射,也可能有多份最优计划。取二维源为 \((-1,0),(1,0)\) 各一半,目标为 \((0,-1),(0,1)\) 各一半。四格平方成本全是2,两种置换都最优。

在时刻 \(t=1/2\),一种配对得到 \((-1/2,-1/2),(1/2,1/2)\);另一种得到 \((-1/2,1/2),(1/2,-1/2)\)。两条路径端点相同,中点不同,成本与速度却同样最优。两置换计划的凸组合还可拆分质量;实验枚举的是两种置换,不把它们当成全部最优耦合。

若每边都恰好两个等权原子,运输多面体是连接这两种置换的线段,目标是仿射函数,所以比较两个端点足以得到全局最优值。这是该实验能精确判定最优的理由。

5. 从最优耦合推出常速测地线

取任一最优耦合 \((X,Y)\sim\pi^*\),记 \(D=W_2(\mu_0,\mu_1)\),定义

\[ X_t=(1-t)X+tY,\qquad \mu_t=\mathcal L(X_t),\qquad 0\leq t\leq1. \]

用同一粒子标签耦合两个时刻,可以先证明上界:

\[ W_2(\mu_s,\mu_t) \leq\|X_s-X_t\|_2=|s-t|D. \]

为什么这里实际上取等?对于 \(0\leq s\leq t\leq1\),三角不等式与这三个上界给出

\[ D\leq W_2(\mu_0,\mu_s)+W_2(\mu_s,\mu_t)+W_2(\mu_t,\mu_1) \leq sD+(t-s)D+(1-t)D=D. \]

总和被夹成同一个数,各段也只能达到对应上界。因此

\[ W_2(\mu_s,\mu_t)=|s-t|D. \]

整个证明无需除以 \(D\),所以相同分布、零距离也包括在内。在欧氏空间中,平方Wasserstein常速测地线都可由最优耦合作这样的位移插值得到;若源有密度,最优计划唯一也给出路径唯一。完整表述见 Santambrogio定理3.2。

若用任意可行耦合 \(\pi\),同样只能得到 \(W_2(\mu_s^\pi,\mu_t^\pi)\leq|s-t|\sqrt{C(\pi)}\),其中 \(C(\pi)=\int|x-y|^2\,d\pi\)。当 \(C(\pi)>D^2\),上面的夹逼不再闭合。第11节给出具体反例。

6. 一维直线插值:对齐分位数,再重新计算距离

一维的量化坐标是广义分位数 \(Q_\mu(u)=F_\mu^{-1}(u)\)。在有限二阶矩条件下,上一课已经证明共同分位数是平方成本的最优配对,所以

\[ W_2^2(\mu,\nu)=\int_0^1|Q_\mu(u)-Q_\nu(u)|^2\,du. \]

两个非降函数的凸组合仍非降,于是位移路径的分位数就是

\[ Q_t=(1-t)Q_0+tQ_1. \]

原子模型中,把每份质量排成概率区间,列出所有交叠段;每段的质量保持不变,位置按上式运动。端点或中间时刻出现真正相同的位置时,要把质量相加。这里的非降性保证后续距离计算仍使用同一量化顺序。

实验同时保留两份证据:从完整段表算粒子的二次位移;从得到的两个实际分布重新作分位数配对算 \(W_2^2\)。它们一致才是模型内的数值核对。时间表包含0到1的等距读数和你输入的两个时刻;曲线连接读数辅助观察,不是额外采样的概率分布。

7. 混合插值也守恒,却可能具有无穷路径长度

混合路径是 \(\widetilde\mu_t=(1-t)\mu_0+t\mu_1\)。它在概率测度的凸集合内作线性组合,保留端点的位置,改变各处质量;位移路径则沿耦合移动位置。两者的均值相同,但方差通常不同。

令 \(m_i=\mathbb EX_i\)、\(V_i=\operatorname{Var}(X_i)\)。混合的方差为

\[ \operatorname{Var}(\widetilde\mu_t) =(1-t)V_0+tV_1+t(1-t)|m_1-m_0|^2. \]

位移的方差还取决于配对中的交叉协方差:

\[ \operatorname{Var}(X_t) =(1-t)^2V_0+t^2V_1+2t(1-t)\operatorname{Cov}(X_0,X_1) \]

(这条写法是一维标量版本)。不能仅凭均值运动相同就判为同一条分布路径。

最小例子 \(\mu_0=\delta_0,\mu_1=\delta_1\) 中,位移为 \(\delta_t\),而混合为 \((1-t)\delta_0+t\delta_1\)。两个混合时刻之间恰有 \(|t-s|\) 的质量需要走单位距离,因此

\[ W_2(\widetilde\mu_s,\widetilde\mu_t)=\sqrt{|t-s|}. \]

把时间分成 \(N\) 等段,距离和是 \(N\sqrt{1/N}=\sqrt N\),趋于无穷。混合曲线连续,却不是这套距离下的有限长度路径。这里是一个明确反例,不是说所有混合路径都无穷长;两端相同时它仍是常值。

8. 一维重心:一个精确的方差分解

给定 \(\mu_1,\ldots,\mu_k\in\mathcal P_2(\mathbb R)\) 与非负权重 \(\lambda_i\),合计为1,定义

\[ J(\nu)=\sum_i\lambda_iW_2^2(\mu_i,\nu). \]

令 \(\overline Q=\sum_i\lambda_iQ_i\)。它仍非降且属于 \(L^2(0,1)\),所以确实对应一份概率分布 \(\overline\mu\)。逐个 \(u\) 展开平方,并用 \(\sum_i\lambda_i(Q_i-\overline Q)=0\) 消掉交叉项:

\[ \sum_i\lambda_i|Q_i-Q|^2 =\sum_i\lambda_i|Q_i-\overline Q|^2+|Q-\overline Q|^2. \]

积分得到完整证书:

\[ J(\nu)-J(\overline\mu)=W_2^2(\nu,\overline\mu)\geq0. \]

所以一维重心唯一;零权重和原子分布都包括在这份直接证明里。实验允许提交另一份候选分布,并把目标差与右侧真实距离逐项核对。有关一维重心与多维问题的区别,可读 Agueh–Carlier第6.1节;该节以非原子映射描述,我们这里用分位数积分直接覆盖原子情形。

多维通常没有一条共同的量化顺序;选一个参考分布,把若干Brenier映射平均后推前,不会自动得到任意多维数据的Wasserstein重心。这里的精确方差恒等式有明确的一维适用范围。

9. 高斯映射:先证明协方差推前,再计算成本

令 \(\mu_i=N(m_i,\Sigma_i)\),源协方差 \(\Sigma_0\) 正定,目标协方差 \(\Sigma_1\) 半正定。设

\[ B=(\Sigma_0^{1/2}\Sigma_1\Sigma_0^{1/2})^{1/2}, \qquad A=\Sigma_0^{-1/2}B\Sigma_0^{-1/2}, \qquad T(x)=m_1+A(x-m_0). \]

\(A\) 对称半正定,因此 \(T\) 是凸二次函数 \(u(x)=\tfrac12x^\top Ax+(m_1-Am_0)\cdot x\) 的梯度。直接乘法验证

\[ A\Sigma_0 A^\top =\Sigma_0^{-1/2}B^2\Sigma_0^{-1/2}=\Sigma_1. \]

仿射变换保持高斯族,均值与协方差都已正确,故 \(T_\#\mu_0=\mu_1\)。它又是凸梯度,因而是最优映射。目标奇异不妨碍从有密度的源压到一条线或一个点;源奇异时这个含逆矩阵的写法不可直接使用。

令 \(X=m_0+Z\)、\(\mathbb EZZ^\top=\Sigma_0\)。展开位移能量得到

\[ \mathbb E|T(X)-X|^2 =|m_1-m_0|^2+\|(A-I)\Sigma_0^{1/2}\|_F^2 =|m_1-m_0|^2+\operatorname{tr}(\Sigma_0+\Sigma_1-2B). \]

最后一步用 \(A\Sigma_0A=\Sigma_1\) 和 \(\operatorname{tr}(A\Sigma_0)=\operatorname{tr}B\)。这就是Gaussian/Bures平方Wasserstein公式,相关矩阵推导见 Bhatia、Jain、Lim第2–3节。实验以平方范数算非负成本,把容易相消的迹公式留作独立数值对照;相同输入协方差直接使用解析恒等映射,并保留通用公式的残差。

插值的均值与协方差为

\[ m_t=(1-t)m_0+tm_1,\qquad \Sigma_t=M_t\Sigma_0M_t^\top,\qquad M_t=(1-t)I+tA. \]

它通常不是 \((1-t)\Sigma_0+t\Sigma_1\)。如果两矩阵不交换,不能把矩阵平方根的次序任意调换。对于一般非高斯分布,相同均值与协方差也不确定分布;把这套公式代入两份矩估计,不能称为原分布的真实 \(W_2\)。

10. 通向动态传输与梯度流的接口

一条粒子路径 \(X_t\) 可以转写为质量连续性方程。若速度可由位置函数 \(v_t\) 表示,对光滑紧支撑检验函数 \(f\),链式法则给出

\[ \frac{d}{dt}\int f\,d\mu_t =\int\nabla f\cdot v_t\,d\mu_t, \qquad \partial_t\mu_t+\nabla\cdot(v_t\mu_t)=0. \]

一般耦合可能有多个粒子在同一位置,用条件平均速度 \(v_t(z)=\mathbb E[Y-X\mid X_t=z]\) 仍可得到弱形式,Jensen不等式给出速度场能量不超过粒子能量。动态公式进一步在所有满足连续性方程与端点约束的曲线上最小化:

\[ W_2^2(\mu_0,\mu_1) =\inf_{\mu_t,v_t}\int_0^1\int|v_t|^2\,d\mu_t\,dt. \]

这里取窄连续概率路径与平方可积的Borel速度,连续性方程按分布理解。Benamou–Brenier公式的这一测度版本见 Peyré动态传输讲义。它与粒子插值相关,但本课的有限时间表不是一般动态方程求解器。

对于足够光滑、严格为正且有适当衰减的密度,熵 \(\mathcal E(\rho)=\int\rho\log\rho\) 的形式变分导数是 \(1+\log\rho\)。取负梯度速度 \(v=-\nabla\log\rho\),连续性方程便成为 \(\partial_t\rho=\Delta\rho\)。这说明热方程与Wasserstein梯度流的联系;原子测度没有这样的密度,不能把对数密度与逐点梯度直接塞给它。

严谨理论通过变分时间步 \(\rho^{k+1}\in\arg\min_\rho\{\mathcal E(\rho)+W_2^2(\rho,\rho^k)/(2\tau)\}\) 等工具建立存在与收敛。此处是后续研究课程的入口;经典解正则性、离散格式收敛与数值误差仍需另证。

11. 四道完整练习:给路径和平均各写一份证书

练习一:拆分之后的半程,和混合有什么不同?

取 \(\mu_0=\delta_0\),\(\mu_1=0.35\delta_{-2}+0.65\delta_2\),求半程分布、两段距离与两种半程方差。

展开完整答案:质量相同,位置与方差不同

最优计划把0的质量分为0.35和0.65,平方成本为 \(0.35\cdot4+0.65\cdot4=4\),所以 \(D=2\)。位移半程是 \(0.35\delta_{-1}+0.65\delta_1\),到两个端点的距离均为1。

混合半程则为 \(0.175\delta_{-2}+0.5\delta_0+0.325\delta_2\)。从源到它的平方成本是2;把它送往目标也恰需把位于0的两部分补往两端,平方成本仍为2,故两段距离均为 \(\sqrt2\)。

两种半程均值都是0.3。位移的二阶矩为1、方差为0.91;混合二阶矩为2、方差为1.91。均值相同不代表分布相同,更不代表路径等长。

练习二:直线运动能把零距离走成来回路吗?

源和目标均为二维两点 \((-1,0),(1,0)\) 各一半,选择交叉配对。求端点最优成本、中点以及1/4和3/4时刻之间的距离。

展开完整答案:粒子标签走了,分布也可能回到原处

保持原位的配对成本为零,所以端点 \(W_2=0\)。交叉配对让每个粒子走长度2,所选计划成本为4;在半程时两点都到0,分布为 \(\delta_{(0,0)}\),显然不是常值路径。

在1/4和3/4时刻,实际分布都为 \((-1/2,0),(1/2,0)\) 各一半,故这两个时刻的 \(W_2=0\)。若坚持同一粒子标签配对,每个粒子却走了长度1,给出的二次成本上界为1。上界不是最优距离;把任意标签运动成本称为分布距离会在这里出错。

练习三:三个点质量的重心怎样验收?

对 \(\delta_0,\delta_2,\delta_4\) 取权重 \(1/4,1/4,1/2\),求重心,并比较候选 \(\delta_2\)。

展开完整答案:目标差等于到重心的平方距离

三份分位数分别恒为0、2、4,加权平均为 \(5/2\),所以重心是 \(\delta_{5/2}\)。最优目标为

\[ \frac14\left(\frac52\right)^2+ \frac14\left(\frac12\right)^2+ \frac12\left(\frac32\right)^2=\frac{11}{4}. \]

候选 \(\delta_2\) 的目标为 \(\tfrac14\cdot4+\tfrac14\cdot0+\tfrac12\cdot4=3\),目标差为 \(1/4\),恰好等于 \(W_2^2(\delta_2,\delta_{5/2})\)。若把三个概率分布直接线性混合,得到的是三个位置的质量,并非这个最优平均。

练习四:高斯协方差平均在哪一步走错?

均值都为0,\(\Sigma_0=\operatorname{diag}(1,4)\)、\(\Sigma_1=\operatorname{diag}(4,1)\)。求最优映射、距离与半程协方差。

展开完整答案:平均标准差方向,而非直接平均方差

在共同对角基下,\(A=\operatorname{diag}(2,1/2)\),它是正定矩阵,且 \(A\Sigma_0A=\Sigma_1\)。零均值的平方成本为

\[ (2-1)^2\cdot1+(1/2-1)^2\cdot4=2, \qquad W_2=\sqrt2. \]

半程 \(M_{1/2}=\operatorname{diag}(3/2,3/4)\),所以 \(\Sigma_{1/2}=\operatorname{diag}(9/4,9/4)\)。直接平均协方差却得到 \(\operatorname{diag}(5/2,5/2)\)。这个逐坐标标准差的读法依赖共同对角化;非交换矩阵要保留完整平方根与矩阵乘法次序。

12. 把几何带入研究,先分清误差来自哪里

这课建立了三个可以复用的判断:最短路需要最优耦合;一维重心来自共同分位数;高斯公式只对相应高斯模型给出完整距离。它们能用于形状插值、分布比较和变分模型,但不会自动保证任意生成算法训练稳定。

在数据问题中,经验分布与总体分布的差、耦合优化没做完的差、正则化改变目标的差,以及分布模型忽略高阶结构的差,是不同来源。统计速率还依赖维数、矩条件、风险是距离还是距离平方,不能只报一个“样本量开方”规则。

下一课:熵正则化与Sinkhorn会把这份几何转成可迭代的数值问题。接下来的首要检查仍是边缘与目标口径:平滑后的耦合可行了吗,计算的是运输成本还是含熵的目标,算法误差和正则化偏差分别多大?