本页目录
观测 II · 反演、数据同化与不确定性
地球系统里,真正想知道的量常常不能直接拿尺子量到。
地下含水量藏在土层中,云滴半径藏在辐射信号后面,海洋内部温度也只在少数剖面上被采样。
反演从观测结果倒推隐藏状态或参数;数据同化则把观测和一个随时间推进的模型放进同一个更新循环。
本页的重点不是把任何一个算法称为“真相机器”,而是学会问:先验从哪里来,观测误差有多大,更新后还剩多少不确定性。
学习层:给流域水储量做一次可审计的更新
1. 具体情境:看得见的河流,藏起来的水
某个教学流域每天有一个水储量状态,单位取为“等效毫米”这一教学单位。
模型根据前一天的状态和降水、蒸散等通量,给出今天的预测;卫星或现场仪器给出一个带误差的观测。
这里的场景是问题设置,不是对某个真实流域的预测,也不代表某个观测站的实际记录。
我们先假设隐藏状态和误差近似为一维高斯量,只为了把每一步的证据写进账本。
2. 揭示前预测:谁应该更靠近更新结果?
在打开实验前,完成两项预测:
- 如果观测噪声变大,后验均值会更靠近先验预测,还是更靠近传感器读数?
- 如果过程不确定性变大而观测质量不变,卡尔曼增益会变小,还是变大?
请先选择答案,再展开控件。提交后实验才会揭示数值账本。
3. 公式桥:先验、似然与后验是同一条信息链
用 \(m_f\) 和 \(P_f\) 表示推进模型后的先验均值与方差,用 \(y\) 表示观测,用 \(R\) 表示观测误差方差。
最小线性高斯观测模型为
一维且 \(H=1\) 时,创新、增益和后验分别为
\(K\) 没有单位;当 \(R\ll P_f\) 时,观测更有话语权,当 \(R\gg P_f\) 时,模型先验更有话语权。
4. 互动实验:把过程噪声和观测噪声分开
JavaScript 失效时的静态 fallback:以下为合成教学输入,不是实测流域数据。默认先验均值 \(m_f=120\)、先验方差 \(P_f=500\)、观测 \(y=150\)、观测方差 \(R=225\),对应观测标准差 \(15\) 个教学单位。
| 量 | 默认结果 | 单位 / 解释 |
|---|---|---|
| 创新 \(d=y-m_f\) | \(30.0\) | 教学单位 |
| 卡尔曼增益 \(K\) | \(0.690\) | 无量纲 |
| 后验均值 \(m_a\) | \(140.7\) | 教学单位 |
| 后验方差 \(P_a\) | \(155.2\) | 教学单位\(^2\) |
| 后验标准差 | \(12.5\) | 教学单位 |
提交两个预测后,控件可改变过程方差、观测噪声、观测值和模型漂移;图中的先验、观测与后验会和账本同步。
5. 边界:一次漂亮更新不等于状态被“测真”
- 线性高斯假设把非对称洪水尾部、截断状态和离群传感器压成了方差,极端风险可能因此被低估。
- \(R\) 不是“仪器型号的一个固定常数”;它依赖空间尺度、代表性误差、预处理和观测时间窗。
- 一维 \(H=1\) 只说明观测直接指向状态。真正的遥感反演常有非线性辐射传输、参数相关性和不可辨识方向。
- 后验方差只对给定模型、先验和误差协方差负责;换一个模型族,后验可能整体移动。
6. 迁移:从标量账本到地球系统网格
把一维状态换成向量 \(\mathbf x\),把 \(P_f\) 换成协方差矩阵 \(\mathbf P_f\),公式中的乘法就变为矩阵运算。
迁移问题:若两个传感器观测同一状态但误差相关,直接把两个独立更新串起来会漏掉什么?如果观测只在训练期覆盖了湿润季节,怎样在报告中标出旱季反演的外推边界?
1. 反演与正问题:箭头反过来,困难增加
正问题给定状态和参数,计算观测:
反演则试图由 \(\mathbf y\) 求 \(\mathbf x\) 或 \(\boldsymbol\theta\)。
正问题通常是“输入一组数,运行模型”;反问题还要判断解是否存在、是否唯一、是否对噪声稳定。
这三件事对应 Hadamard 的适定性要求:存在性、唯一性和连续依赖。
1.1 一个数量级直觉:信息维数不能凭空增加
如果只有 10 个独立观测,却想同时解析 1000 个互不相关的网格状态,问题通常需要先验、正则化或降维。
这不是计算机内存不够,而是数据中可用的信息方向不足。
把观测算子线性化为 \(\mathbf H\) 后,奇异值很小的方向对噪声特别敏感;这些方向就是反演的软肋。
1.2 正则化把“偏好”写在公式里
一个常见的二次目标是
第一项惩罚观测不一致,第二项把背景状态或平滑结构作为偏好,\(\lambda\) 控制两者权衡。
正则化不是凭空创造信息;它以可解释的偏好换取稳定性。
2. 数据同化的时间循环
设状态转移为
其中 \(\boldsymbol\eta_t\) 是过程误差。
一个最小循环包含:预报、接收观测、计算创新、更新、再预报。
过程噪声 \(\mathbf Q\) 描述模型没有写出的天气、混合和参数漂移;观测噪声 \(\mathbf R\) 描述仪器和代表性误差。
把所有偏差都塞进 \(\mathbf R\) 会让模型看起来过于自信,把所有误差都塞进 \(\mathbf Q\) 又会让观测几乎失去约束力。
2.1 创新是一个诊断,不只是一个差
创新 \(d\) 大不一定说明模型错了:它也可能来自一次低概率观测噪声或未建模的突变。
标准化创新可写为
连续出现同号且过大的 \(z\),比单个大残差更提示偏差、漂移或错误的误差协方差。
2.2 数值稳定性与可追溯性
矩阵实现中应尽量使用平方根滤波、Cholesky 分解或等价稳定算法,而不是显式求逆。
每次更新至少记录时间戳、观测版本、模型版本、\(Q/R\) 设定、创新和拒绝规则。
这份 provenance 账本让别人能区分“数据没来”“数据被拒绝”和“模型确实更新了”。
3. 常见误区清单
误区一:后验更窄,所以一定更正确。
后验方差变小只说明在当前假设中不确定性被压缩;如果观测偏差没有进入模型,窄区间可能是过度自信。
误区二:观测越多,信息就线性增加。
空间上高度相关的像元或时间上重复采样的传感器,提供的独立信息远少于计数值。
误区三:同化等于把观测硬塞进模型。
更新权重取决于误差协方差和观测算子;硬替换会破坏守恒、动力学或跨变量一致性。
误区四:反演输出的小数位代表精度。
计算器可以给出很多位,但输入误差、模型结构误差和尺度不匹配决定了有效精度。
4. 量级、单位与证据边界
卫星反演常把辐亮度、反射率、微波亮温或雷达回波转换成地表变量;中间的物理单位和校准链不能被一个“指数”隐藏。
本页实验的 100、150 等数字只是无量纲教学单位;不代表某个流域的毫米、水位或土壤含水量。
动态观测数字若被加入课程,应同时写明指标年、基准时段、不确定度与核验日期;本页不引入当前观测数值。
可作为证据入口的资料包括 IPCC AR6 WGI 的观测与模型评估、NASA Earth science 的地球观测入口,以及 NOAA 的数据与教育资源。链接是资料入口,不替代具体产品的版本和元数据。
5. 从反演走向归因
反演问“隐藏状态是什么”;检测与归因还要问“变化是否超出内部变率,以及哪些外部强迫能解释指纹”。
这一步不能只把相关性换成更漂亮的图,而要把零假设、对照模拟、有效样本量和替代解释分开。
下一章把这个证据链压缩成一个可操作的指纹回归实验。