本页目录

前沿 I · 学习型控制

核对于 2026-07证据地位:仿真中的成果【实】;真实设备上的通用性【争】——本页需要谨慎区分。 🔗 与 AI 站强化学习线直接对接。 前面十九页的方法都需要模型(或至少需要能整定的结构)。当对象难以建模(柔性材料、接触丰富的操作、复杂流体)、或任务难以用二次型代价表达("把衣服叠好")时,能否让系统从数据中学会控制?这是当前投入最大、也最容易被夸大的方向。

一、强化学习与控制:同一个问题的两种语言

它们研究的是同一件事,只是传统不同:

控制 强化学习
状态 \(x\)、输入 \(u\) 状态 \(s\)、动作 \(a\)
代价 \(J\)(最小化) 回报 \(R\)(最大化)
对象模型 环境/转移概率
最优控制、HJB 方程 Bellman 方程、值函数
LQR 线性二次情形的解析解

Bellman 方程与 HJB 方程本质相同(第十七页)。差别在传统与假设:控制假定有模型、要求稳定性证明、面向物理系统;RL 假定模型未知、靠试错、最初面向游戏与仿真。

一个常被忽略的历史事实:动态规划(Bellman,1950 年代)同时是两个领域的源头。"强化学习是新东西"是一种错觉——新的是深度网络作为函数逼近器,以及由此带来的规模。

二、主要路线

① 无模型 RL(model-free):直接从交互中学策略(PPO、SAC 等)。

② 基于模型的 RL / 学习型 MPC:先从数据学一个动态模型,再用规划或 MPC 求解。

③ 模仿学习 / 从演示学习:从人类示范中学策略。避开了奖励设计,但存在分布偏移问题(一旦偏离演示轨迹就进入没见过的状态),需 DAgger 等方法缓解。

④ 学习 + 传统控制的混合这是工程上最现实的路线——

三、sim2real:核心工程难题

真实交互昂贵,于是先在仿真中训练,再迁移到实物。但仿真与现实总有差距(reality gap):接触与摩擦模型不准、传感器噪声与延迟、执行器动态、材料参数。

主流缓解手段

诚实的现状:sim2real 在运动控制类任务(足式机器人行走、无人机敏捷飞行)上已有相当扎实的成功;在接触丰富的精细操作(柔性物体、装配)上仍然困难,因为接触与形变的仿真本身就不准。

四、为什么工业采用缓慢【争】

这是本页最需要诚实的部分。学习型控制在论文与演示中成果惊人,但在工业控制中的实际部署仍然有限,原因具体:

① 无稳定性与安全保证:神经网络策略难以给出第十五页那样的 Lyapunov 证明。在会伤人或损失巨大的系统上,"通常有效"不足以投运(承第十四页功能安全:需要的是可论证的保证)。

② 分布外行为不可预测:遇到训练中未出现的工况,行为可能任意。而工业系统的价值恰恰体现在异常工况下仍然安全

③ 可验证性与认证:第十四页说过,安全相关软件依赖流程与验证。一个百万参数的策略如何验证、如何认证、如何做变更管理,目前没有成熟答案。

④ 数据获取昂贵:工业设备不允许大量试错,且故障数据天然稀缺。

⑤ 可维护性:现场工程师能调 PID,但无法调一个神经网络(承第十三、十六页反复出现的同一约束)。

⑥ 与现有方法的比较常不公平:许多论文把学习方法与未经认真整定的 PID 比较。精心整定的传统控制器往往比宣传的更强——这是判读此类工作时最该警惕的一点。

判读一篇学习型控制论文的清单

  1. 是仿真还是真实硬件
  2. 认真整定的传统方法比了吗?
  3. 需要多少交互样本?
  4. 分布外与故障工况测试了吗?
  5. 有无安全保证机制?

五、真正有前景的落点

不是"取代 PID",而是几个传统方法确实力不从心的地方:

注意最后两条的共同特征把学习放在闭环之外或结构之内,而非让它直接接管闭环。 这与第十八页"工业偏好增益调度胜过在线自适应"是同一个逻辑——可验证性优先

六、要点


下一页:如果要让学习型控制器真正进入安全关键系统,就必须回答一个问题——如何在保留灵活性的同时,给出可证明的安全保证?