本页目录

前沿 I · 学习型控制

核对于 2026-07 | 证据地位:仿真中的成果【实】;真实设备上的通用性【争】——本页需要谨慎区分。 🔗 与 AI 站强化学习线直接对接。 前面十九页的方法都需要模型(或至少需要能整定的结构)。当对象难以建模(柔性材料、接触丰富的操作、复杂流体)、或任务难以用二次型代价表达("把衣服叠好")时,能否让系统从数据中学会控制?这是当前投入最大、也最容易被夸大的方向。

学习层:让学习残差在训练区内工作,在 OOD 边界外交回保守控制器

1. 具体工程谜题:模型优化器找到的“好动作”,出了训练区还能信吗?

考虑一个一维离散对象。标称模型知道线性项,但学习器只在 \(|x|\le r_{train}\) 的数据上拟合残差。控制器在模型中搜索动作,可能利用残差预测的错误,把状态推向一个模型里看似便宜、真实对象却不安全的区域。工程设计要决定:什么时候使用学习控制器,什么时候用固定 fallback;不确定性升高时,门控应该牺牲多少性能换取可解释性。

预测门,必须先作答:

  1. 当 \(|x|\) 超过训练半径时,不确定性应继续沿用训练区内的数值,还是增大并触发门控?
  2. 优化器能否通过钻模型漏洞,在预测中得到低代价、在真实对象上却偏离的动作?
  3. 交回 fallback 后,能否仅凭一次仿真就宣布整个系统稳定?

2. 正式模型:残差、置信边界、动作门控分开记账

本实验使用

\[ x_{k+1}=a x_k+b u_k+r_{true}(x_k),\qquad \hat x_{k+1}=a x_k+b u_k+\hat r(x_k), \]

其中 \(a=0.92,b=0.18\),学习残差在 \(|x|\le r_{train}\) 内接近真值;离开训练区后,\(\hat r\) 采用外推,误差和不确定性 \(\sigma(x)\) 随距离增长。学习动作由模型优化或残差补偿产生,fallback 为 \(u_{safe}=\operatorname{sat}(-K_{safe}x)\)。本页的门控规则是示例:仅当 \(|x|\le r_{train}\) 且 \(\sigma(x)\le\sigma_{max}\) 时采用学习动作,否则交回 fallback。它是运行时风险控制结构,不是 Lyapunov 或认证证明。

3. 动手实验:比较 gated、ungated 和真实一步误差

先提交三项预测,再调初始状态、训练半径、不确定性阈值、学习增益、fallback 增益和真实残差失配。SVG 画训练区边界、状态轨迹、学习/安全动作;ledger 逐行列 \(x_k\)、\(\hat r\)、\(r_{true}\)、\(\sigma\)、门控结果、预测下一状态和真实下一状态。证据区额外显示“优化器模型收益”和“真实一步残差”,把 OOD exploitation 和控制器输出是否越界分开。

JavaScript 失效时的静态 fallback:默认从 \(x_0=1.25\) 开始,训练半径 \(r_{train}=1.0\),\(a=0.92,b=0.18\)。初始状态在训练区外,所以门控先交回 \(u_{safe}\);轨迹进入 \(\lvert x\rvert\le1.0\) 且不确定性未越阈值后,才允许学习动作。若关闭门控,优化器会继续使用外推残差,账本会显示预测下一状态与真实下一状态的差值;该差值是状态单位的模型误差,不是概率或准确率分数。

证据 解释
in-distribution \(\lvert x\rvert\le r_{train}\) 且不确定性未越阈值
OOD-gated 超出训练区/置信阈值,采用 fallback
model exploit 优化器预测改善,但真实一步误差增大
safety action 被限幅的保守动作,不代表全局稳定

4. 误区与模型边界

  • 训练集内表现不等于泛化保证:训练分布、传感器延迟、动作饱和和真实扰动都要在验证数据中明确覆盖。
  • 不确定性分数不是概率校准:本实验的 \(\sigma\) 是随 OOD 距离增长的 proxy,除非另有校准数据,不能解释成“失效概率”。
  • 门控不自动证明 fallback 安全:fallback 也需要输入范围、执行器约束、对象模型和扰动边界的独立分析。
  • 优化器会利用模型错误:模型中便宜的轨迹可能是现实中的漏洞;要用真实数据、保守约束、集成不确定性或安全过滤器阻止这种捷径。
  • 一次短仿真不等于部署证据:还要测试训练边界、传感器异常、延迟、饱和、故障恢复和版本变更。

5. 正式回到学习型控制:把“学到了什么”和“允许它做什么”分开

可交付的返回值不是一个总分,而是一张范围表:训练支持的状态集合、残差误差、门控规则、fallback 行为、动作/状态限制,以及 OOD 时的降级证据。学习器可以扩大模型能力,但安全边界必须由独立、可检查的结构定义;这正是混合控制比直接放行策略更容易工程化的原因。

迁移问题:如果视觉伺服只在白色零件和低速下训练,而现场出现反光零件、遮挡和高速运动,你会怎样设计 OOD 指标、fallback、动作限幅和再训练验收?请分别写出训练内性能、边界外拒绝率和真实设备安全证据。

一、强化学习与控制:同一个问题的两种语言

它们研究的是同一件事,只是传统不同:

控制 强化学习
状态 \(x\)、输入 \(u\) 状态 \(s\)、动作 \(a\)
代价 \(J\)(最小化) 回报 \(R\)(最大化)
对象模型 环境/转移概率
最优控制、HJB 方程 Bellman 方程、值函数
LQR 线性二次情形的解析解

Bellman 方程与 HJB 方程是相关但不相同的动态规划方程(第十七页):Bellman 常写离散时间递推,HJB 是连续时间极限/连续时间最优控制的偏微分方程;在相应正则性、动力学和代价假设下可以互相对应。控制与 RL 也不是“有模型/无模型”的二分:控制可以做数据驱动设计,RL 也可以使用模型;真正要比较的是信息来源、目标、约束和可验证保证。

一个常被忽略的历史事实:动态规划(Bellman,1950 年代)同时是两个领域的源头。"强化学习是新东西"是一种错觉——新的是深度网络作为函数逼近器,以及由此带来的规模。

二、主要路线

① 无模型 RL(model-free):直接从交互中学策略(PPO、SAC 等)。

② 基于模型的 RL / 学习型 MPC:先从数据学一个动态模型,再用规划或 MPC 求解。

③ 模仿学习 / 从演示学习:从人类示范中学策略。避开了奖励设计,但存在分布偏移问题(一旦偏离演示轨迹就进入没见过的状态),需 DAgger 等方法缓解。

④ 学习 + 传统控制的混合:在底层控制器、门控和约束已有独立证据的条件下,这通常是较易审计的一条路线——

三、sim2real:核心工程难题

真实交互昂贵,于是先在仿真中训练,再迁移到实物。但仿真与现实总有差距(reality gap):接触与摩擦模型不准、传感器噪声与延迟、执行器动态、材料参数。

主流缓解手段:

诚实的现状:sim2real 在运动控制类任务(足式机器人行走、无人机敏捷飞行)上已有相当扎实的成功;在接触丰富的精细操作(柔性物体、装配)上仍然困难,因为接触与形变的仿真本身就不准。

四、为什么工业采用缓慢【争】

这是本页最需要诚实的部分。学习型控制在论文与演示中成果惊人,但在工业控制中的实际部署仍然有限,原因具体:

① 无稳定性与安全保证:神经网络策略难以给出第十五页那样的 Lyapunov 证明。在会伤人或损失巨大的系统上,"通常有效"不足以投运(承第十四页功能安全:需要的是可论证的保证)。

② 分布外行为不可预测:遇到训练中未出现的工况,行为可能任意。而工业系统的价值恰恰体现在异常工况下仍然安全。

③ 可验证性与认证:第十四页说过,安全相关软件依赖流程与验证。针对特定行业已有运行时监控、受限功能、仿真/试验覆盖和保证案例等路线,但对高维学习策略还没有一套跨行业、一次适用的通用认证答案;模型更新与变更管理尤其需要单独论证。

④ 数据获取昂贵:工业设备不允许大量试错,且故障数据天然稀缺。

⑤ 可维护性:现场工程师能调 PID,但无法调一个神经网络(承第十三、十六页反复出现的同一约束)。

⑥ 与现有方法的比较常不公平:许多论文把学习方法与未经认真整定的 PID 比较。精心整定的传统控制器往往比宣传的更强——这是判读此类工作时最该警惕的一点。

判读一篇学习型控制论文的清单:

  1. 是仿真还是真实硬件?
  2. 与认真整定的传统方法比了吗?
  3. 需要多少交互样本?
  4. 分布外与故障工况测试了吗?
  5. 有无安全保证机制?

五、真正有前景的落点

不是"取代 PID",而是几个传统方法确实力不从心的地方:

注意最后两条的共同特征:把学习放在闭环之外或结构之内,而非让它直接接管闭环。 这与第十八页"工业偏好增益调度胜过在线自适应"是同一个逻辑——可验证性优先。

六、要点


下一页:如果要让学习型控制器真正进入安全关键系统,就必须回答一个问题——如何在保留灵活性的同时,给出可证明的安全保证?