本页目录

观测 II · 反演、数据同化与不确定性

地球系统里,真正想知道的量常常不能直接拿尺子量到。

地下含水量藏在土层中,云滴半径藏在辐射信号后面,海洋内部温度也只在少数剖面上被采样。

反演从观测结果倒推隐藏状态或参数;数据同化则把观测和一个随时间推进的模型放进同一个更新循环。

本页的重点不是把任何一个算法称为“真相机器”,而是学会问:先验从哪里来,观测误差有多大,更新后还剩多少不确定性。

数据同化的时间循环:先验、观测、创新与分析状态

图 22.1数据同化把模型推进、有限观测、创新和分析状态放进一个时间循环。本图是流程示意,节点、箭头和状态空间非按比例;输入是合成情景,观测带有误差,分析场是给定模型与误差假设下的估计,不是真值,也不是预报。

反问题的分辨率与信息方向

图 22.2正问题沿状态到信号的方向生成观测,反问题沿信号到估计的方向依赖观测算子与正则化。本图是信息结构示意,奇异值和维数非按比例;观测是有限采样,估计场是条件化分析,不应被当作真值或未来预报。

学习层:给流域水储量做一次可审计的更新

1. 具体情境:看得见的河流,藏起来的水

某个教学流域每天有一个水储量状态,单位取为“等效毫米”这一教学单位。

模型根据前一天的状态和降水、蒸散等通量,给出今天的预测;卫星或现场仪器给出一个带误差的观测。

这里的场景是问题设置,不是对某个真实流域的预测,也不代表某个观测站的实际记录。

我们先假设隐藏状态和误差近似为一维高斯量,只为了把每一步的证据写进账本。

2. 揭示前预测:谁应该更靠近更新结果?

在打开实验前,完成两项预测:

  1. 如果观测噪声变大,后验均值会更靠近先验预测,还是更靠近传感器读数?
  2. 如果过程不确定性变大而观测质量不变,卡尔曼增益会变小,还是变大?

请先选择答案,再展开控件。提交后实验才会揭示数值账本。

3. 公式桥:先验、似然与后验是同一条信息链

用 \(m_f\) 和 \(P_f\) 表示推进模型后的先验均值与方差,用 \(y\) 表示观测,用 \(R\) 表示观测误差方差。

最小线性高斯观测模型为

\[ y=Hx+\varepsilon,\qquad \varepsilon\sim\mathcal N(0,R). \]

一维且 \(H=1\) 时,创新、增益和后验分别为

\[ d=y-m_f, \qquad K=\frac{P_f}{P_f+R}, \]
\[ m_a=m_f+Kd, \qquad P_a=(1-K)P_f. \]

\(K\) 没有单位;当 \(R\ll P_f\) 时,观测更有话语权,当 \(R\gg P_f\) 时,模型先验更有话语权。

4. 互动实验:把过程噪声和观测噪声分开

JavaScript 失效时的静态 fallback:以下为合成教学输入,不是实测流域数据。默认先验均值 \(m_f=120\)、先验方差 \(P_f=500\)、观测 \(y=150\)、观测方差 \(R=225\),对应观测标准差 \(15\) 个教学单位。

量 默认结果 单位 / 解释
创新 \(d=y-m_f\) \(30.0\) 教学单位
卡尔曼增益 \(K\) \(0.690\) 无量纲
后验均值 \(m_a\) \(140.7\) 教学单位
后验方差 \(P_a\) \(155.2\) 教学单位\(^2\)
后验标准差 \(12.5\) 教学单位

提交两个预测后,控件可改变过程方差、观测噪声、观测值和模型漂移;图中的先验、观测与后验会和账本同步。

5. 边界:一次漂亮更新不等于状态被“测真”

  • 线性高斯假设把非对称洪水尾部、截断状态和离群传感器压成了方差,极端风险可能因此被低估。
  • \(R\) 不是“仪器型号的一个固定常数”;它依赖空间尺度、代表性误差、预处理和观测时间窗。
  • 一维 \(H=1\) 只说明观测直接指向状态。真正的遥感反演常有非线性辐射传输、参数相关性和不可辨识方向。
  • 后验方差只对给定模型、先验和误差协方差负责;换一个模型族,后验可能整体移动。

6. 迁移:从标量账本到地球系统网格

把一维状态换成向量 \(\mathbf x\),把 \(P_f\) 换成协方差矩阵 \(\mathbf P_f\),公式中的乘法就变为矩阵运算。

迁移问题:若两个传感器观测同一状态但误差相关,直接把两个独立更新串起来会漏掉什么?如果观测只在训练期覆盖了湿润季节,怎样在报告中标出旱季反演的外推边界?

1. 反演与正问题:箭头反过来,困难增加

正问题给定状态和参数,计算观测:

\[ \mathbf y=\mathcal H(\mathbf x,\boldsymbol\theta)+\boldsymbol\varepsilon. \]

反演则试图由 \(\mathbf y\) 求 \(\mathbf x\) 或 \(\boldsymbol\theta\)。

正问题通常是“输入一组数,运行模型”;反问题还要判断解是否存在、是否唯一、是否对噪声稳定。

这三件事对应 Hadamard 的适定性要求:存在性、唯一性和连续依赖。

1.1 一个数量级直觉:信息维数不能凭空增加

如果只有 10 个独立观测,却想同时解析 1000 个互不相关的网格状态,问题通常需要先验、正则化或降维。

这不是计算机内存不够,而是数据中可用的信息方向不足。

把观测算子线性化为 \(\mathbf H\) 后,奇异值很小的方向对噪声特别敏感;这些方向就是反演的软肋。

1.2 正则化把“偏好”写在公式里

一个常见的二次目标是

\[ J(\mathbf x)= \lVert\mathbf y-\mathbf H\mathbf x\rVert_{\mathbf R^{-1}}^2+ \lambda\lVert\mathbf L(\mathbf x-\mathbf x_b)\rVert^2. \]

第一项惩罚观测不一致,第二项把背景状态或平滑结构作为偏好,\(\lambda\) 控制两者权衡。

正则化不是凭空创造信息;它以可解释的偏好换取稳定性。

2. 数据同化的时间循环

设状态转移为

\[ \mathbf x_{t}=\mathcal M_t(\mathbf x_{t-1})+\boldsymbol\eta_t, \]

其中 \(\boldsymbol\eta_t\) 是过程误差。

一个最小循环包含:预报、接收观测、计算创新、更新、再预报。

过程噪声 \(\mathbf Q\) 描述模型没有写出的天气、混合和参数漂移;观测噪声 \(\mathbf R\) 描述仪器和代表性误差。

把所有偏差都塞进 \(\mathbf R\) 会让模型看起来过于自信,把所有误差都塞进 \(\mathbf Q\) 又会让观测几乎失去约束力。

2.1 创新是一个诊断,不只是一个差

创新 \(d\) 大不一定说明模型错了:它也可能来自一次低概率观测噪声或未建模的突变。

标准化创新可写为

\[ z=\frac{d}{\sqrt{P_f+R}}. \]

连续出现同号且过大的 \(z\),比单个大残差更提示偏差、漂移或错误的误差协方差。

2.2 数值稳定性与可追溯性

矩阵实现中应尽量使用平方根滤波、Cholesky 分解或等价稳定算法,而不是显式求逆。

每次更新至少记录时间戳、观测版本、模型版本、\(Q/R\) 设定、创新和拒绝规则。

这份 provenance 账本让别人能区分“数据没来”“数据被拒绝”和“模型确实更新了”。

3. 常见误区清单

误区一:后验更窄,所以一定更正确。

后验方差变小只说明在当前假设中不确定性被压缩;如果观测偏差没有进入模型,窄区间可能是过度自信。

误区二:观测越多,信息就线性增加。

空间上高度相关的像元或时间上重复采样的传感器,提供的独立信息远少于计数值。

误区三:同化等于把观测硬塞进模型。

更新权重取决于误差协方差和观测算子;硬替换会破坏守恒、动力学或跨变量一致性。

误区四:反演输出的小数位代表精度。

计算器可以给出很多位,但输入误差、模型结构误差和尺度不匹配决定了有效精度。

4. 量级、单位与证据边界

卫星反演常把辐亮度、反射率、微波亮温或雷达回波转换成地表变量;中间的物理单位和校准链不能被一个“指数”隐藏。

本页实验的 100、150 等数字只是无量纲教学单位;不代表某个流域的毫米、水位或土壤含水量。

动态观测数字若被加入课程,应同时写明指标年、基准时段、不确定度与核验日期;本页不引入当前观测数值。

可作为证据入口的资料包括 IPCC AR6 WGI 的观测与模型评估、NASA Earth science 的地球观测入口,以及 NOAA 的数据与教育资源。链接是资料入口,不替代具体产品的版本和元数据。

5. 从反演走向归因

反演问“隐藏状态是什么”;检测与归因还要问“变化是否超出内部变率,以及哪些外部强迫能解释指纹”。

这一步不能只把相关性换成更漂亮的图,而要把零假设、对照模拟、有效样本量和替代解释分开。

下一章把这个证据链压缩成一个可操作的指纹回归实验。