前沿 I · 学习型控制
核对于 2026-07 | 证据地位:仿真中的成果【实】;真实设备上的通用性【争】——本页需要谨慎区分。 🔗 与 AI 站强化学习线直接对接。 前面十九页的方法都需要模型(或至少需要能整定的结构)。当对象难以建模(柔性材料、接触丰富的操作、复杂流体)、或任务难以用二次型代价表达("把衣服叠好")时,能否让系统从数据中学会控制?这是当前投入最大、也最容易被夸大的方向。
一、强化学习与控制:同一个问题的两种语言
它们研究的是同一件事,只是传统不同:
| 控制 | 强化学习 |
|---|---|
| 状态 \(x\)、输入 \(u\) | 状态 \(s\)、动作 \(a\) |
| 代价 \(J\)(最小化) | 回报 \(R\)(最大化) |
| 对象模型 | 环境/转移概率 |
| 最优控制、HJB 方程 | Bellman 方程、值函数 |
| LQR | 线性二次情形的解析解 |
Bellman 方程与 HJB 方程本质相同(第十七页)。差别在传统与假设:控制假定有模型、要求稳定性证明、面向物理系统;RL 假定模型未知、靠试错、最初面向游戏与仿真。
一个常被忽略的历史事实:动态规划(Bellman,1950 年代)同时是两个领域的源头。"强化学习是新东西"是一种错觉——新的是深度网络作为函数逼近器,以及由此带来的规模。
二、主要路线
① 无模型 RL(model-free):直接从交互中学策略(PPO、SAC 等)。
- 优点:不需要模型;
- 致命弱点:样本效率极低——常需百万到十亿次交互。在仿真中可行,在真实设备上通常不可行(一台真实机器人跑不了一百万次尝试,而且会先坏掉)。
② 基于模型的 RL / 学习型 MPC:先从数据学一个动态模型,再用规划或 MPC 求解。
- 样本效率高得多(这是它对真实系统更实用的原因);
- 与第十七、十八页直接接续:这本质上就是"辨识 + MPC",只是模型可以是神经网络;
- 难点:模型误差在长时域预测中累积;优化器会利用模型的错误(找到模型里存在、现实中不存在的"漏洞")——这是基于模型 RL 的典型失效模式。
③ 模仿学习 / 从演示学习:从人类示范中学策略。避开了奖励设计,但存在分布偏移问题(一旦偏离演示轨迹就进入没见过的状态),需 DAgger 等方法缓解。
④ 学习 + 传统控制的混合:这是工程上最现实的路线——
- 用学习补偿模型残差(在物理模型基础上学一个修正项);
- 用学习做高层决策,底层仍用可验证的控制器执行;
- 用学习整定传统控制器的参数。 保留了传统方法的稳定性保证,同时获得数据的灵活性。
三、sim2real:核心工程难题
真实交互昂贵,于是先在仿真中训练,再迁移到实物。但仿真与现实总有差距(reality gap):接触与摩擦模型不准、传感器噪声与延迟、执行器动态、材料参数。
主流缓解手段:
- 域随机化:训练时随机化物理参数、纹理、延迟,迫使策略对参数不敏感——本质上是在追求鲁棒性(🔗 第十六页:这与 \(H_\infty\) 的"为一族模型设计"精神相通,只是用采样代替了范数界);
- 系统辨识 + 仿真校准(第十八页);
- 真实数据微调;
- 保守的动作空间(限制策略输出范围)。
诚实的现状:sim2real 在运动控制类任务(足式机器人行走、无人机敏捷飞行)上已有相当扎实的成功;在接触丰富的精细操作(柔性物体、装配)上仍然困难,因为接触与形变的仿真本身就不准。
四、为什么工业采用缓慢【争】
这是本页最需要诚实的部分。学习型控制在论文与演示中成果惊人,但在工业控制中的实际部署仍然有限,原因具体:
① 无稳定性与安全保证:神经网络策略难以给出第十五页那样的 Lyapunov 证明。在会伤人或损失巨大的系统上,"通常有效"不足以投运(承第十四页功能安全:需要的是可论证的保证)。
② 分布外行为不可预测:遇到训练中未出现的工况,行为可能任意。而工业系统的价值恰恰体现在异常工况下仍然安全。
③ 可验证性与认证:第十四页说过,安全相关软件依赖流程与验证。一个百万参数的策略如何验证、如何认证、如何做变更管理,目前没有成熟答案。
④ 数据获取昂贵:工业设备不允许大量试错,且故障数据天然稀缺。
⑤ 可维护性:现场工程师能调 PID,但无法调一个神经网络(承第十三、十六页反复出现的同一约束)。
⑥ 与现有方法的比较常不公平:许多论文把学习方法与未经认真整定的 PID 比较。精心整定的传统控制器往往比宣传的更强——这是判读此类工作时最该警惕的一点。
判读一篇学习型控制论文的清单:
- 是仿真还是真实硬件?
- 与认真整定的传统方法比了吗?
- 需要多少交互样本?
- 分布外与故障工况测试了吗?
- 有无安全保证机制?
五、真正有前景的落点
不是"取代 PID",而是几个传统方法确实力不从心的地方:
- 难以建模的对象:柔性体、颗粒物料、复杂流体、生物过程;
- 高维感知输入:直接从视觉到动作(传统控制难以处理图像输入);
- 多任务与泛化:一个策略适应多种工况,减少逐一调试的工程量;
- 参数自整定:用学习自动完成过去靠人的整定工作——这可能是最快落地的一类,因为它保留了传统控制器结构(可验证),只把整定自动化;
- 异常检测与预测性维护:不直接闭环控制,风险低、价值明确,是当前落地最广的一类。
注意最后两条的共同特征:把学习放在闭环之外或结构之内,而非让它直接接管闭环。 这与第十八页"工业偏好增益调度胜过在线自适应"是同一个逻辑——可验证性优先。
六、要点
- RL 与最优控制同源(Bellman/HJB),新的是深度函数逼近与规模;
- 无模型 RL 样本效率低,真实设备上通常不可行;基于模型的方法更实用;
- 混合路线(学习补偿 + 传统控制执行)是工程最现实的选择;
- sim2real 靠域随机化等手段追求鲁棒性,在运动控制上成功,在精细接触上仍难;
- 工业采用受限于安全保证、可验证性与可维护性,而非性能;
- 最快落地的是"闭环之外"的应用(自整定、异常检测)。
下一页:如果要让学习型控制器真正进入安全关键系统,就必须回答一个问题——如何在保留灵活性的同时,给出可证明的安全保证?