本页目录
前沿 I · 学习型控制
核对于 2026-07 | 证据地位:仿真中的成果【实】;真实设备上的通用性【争】——本页需要谨慎区分。 🔗 与 AI 站强化学习线直接对接。 前面十九页的方法都需要模型(或至少需要能整定的结构)。当对象难以建模(柔性材料、接触丰富的操作、复杂流体)、或任务难以用二次型代价表达("把衣服叠好")时,能否让系统从数据中学会控制?这是当前投入最大、也最容易被夸大的方向。
学习层:让学习残差在训练区内工作,在 OOD 边界外交回保守控制器
1. 具体工程谜题:模型优化器找到的“好动作”,出了训练区还能信吗?
考虑一个一维离散对象。标称模型知道线性项,但学习器只在 \(|x|\le r_{train}\) 的数据上拟合残差。控制器在模型中搜索动作,可能利用残差预测的错误,把状态推向一个模型里看似便宜、真实对象却不安全的区域。工程设计要决定:什么时候使用学习控制器,什么时候用固定 fallback;不确定性升高时,门控应该牺牲多少性能换取可解释性。
预测门,必须先作答:
- 当 \(|x|\) 超过训练半径时,不确定性应继续沿用训练区内的数值,还是增大并触发门控?
- 优化器能否通过钻模型漏洞,在预测中得到低代价、在真实对象上却偏离的动作?
- 交回 fallback 后,能否仅凭一次仿真就宣布整个系统稳定?
2. 正式模型:残差、置信边界、动作门控分开记账
本实验使用
其中 \(a=0.92,b=0.18\),学习残差在 \(|x|\le r_{train}\) 内接近真值;离开训练区后,\(\hat r\) 采用外推,误差和不确定性 \(\sigma(x)\) 随距离增长。学习动作由模型优化或残差补偿产生,fallback 为 \(u_{safe}=\operatorname{sat}(-K_{safe}x)\)。本页的门控规则是示例:仅当 \(|x|\le r_{train}\) 且 \(\sigma(x)\le\sigma_{max}\) 时采用学习动作,否则交回 fallback。它是运行时风险控制结构,不是 Lyapunov 或认证证明。
3. 动手实验:比较 gated、ungated 和真实一步误差
先提交三项预测,再调初始状态、训练半径、不确定性阈值、学习增益、fallback 增益和真实残差失配。SVG 画训练区边界、状态轨迹、学习/安全动作;ledger 逐行列 \(x_k\)、\(\hat r\)、\(r_{true}\)、\(\sigma\)、门控结果、预测下一状态和真实下一状态。证据区额外显示“优化器模型收益”和“真实一步残差”,把 OOD exploitation 和控制器输出是否越界分开。
JavaScript 失效时的静态 fallback:默认从 \(x_0=1.25\) 开始,训练半径 \(r_{train}=1.0\),\(a=0.92,b=0.18\)。初始状态在训练区外,所以门控先交回 \(u_{safe}\);轨迹进入 \(\lvert x\rvert\le1.0\) 且不确定性未越阈值后,才允许学习动作。若关闭门控,优化器会继续使用外推残差,账本会显示预测下一状态与真实下一状态的差值;该差值是状态单位的模型误差,不是概率或准确率分数。
| 证据 | 解释 |
|---|---|
in-distribution |
\(\lvert x\rvert\le r_{train}\) 且不确定性未越阈值 |
OOD-gated |
超出训练区/置信阈值,采用 fallback |
model exploit |
优化器预测改善,但真实一步误差增大 |
safety action |
被限幅的保守动作,不代表全局稳定 |
4. 误区与模型边界
- 训练集内表现不等于泛化保证:训练分布、传感器延迟、动作饱和和真实扰动都要在验证数据中明确覆盖。
- 不确定性分数不是概率校准:本实验的 \(\sigma\) 是随 OOD 距离增长的 proxy,除非另有校准数据,不能解释成“失效概率”。
- 门控不自动证明 fallback 安全:fallback 也需要输入范围、执行器约束、对象模型和扰动边界的独立分析。
- 优化器会利用模型错误:模型中便宜的轨迹可能是现实中的漏洞;要用真实数据、保守约束、集成不确定性或安全过滤器阻止这种捷径。
- 一次短仿真不等于部署证据:还要测试训练边界、传感器异常、延迟、饱和、故障恢复和版本变更。
5. 正式回到学习型控制:把“学到了什么”和“允许它做什么”分开
可交付的返回值不是一个总分,而是一张范围表:训练支持的状态集合、残差误差、门控规则、fallback 行为、动作/状态限制,以及 OOD 时的降级证据。学习器可以扩大模型能力,但安全边界必须由独立、可检查的结构定义;这正是混合控制比直接放行策略更容易工程化的原因。
迁移问题:如果视觉伺服只在白色零件和低速下训练,而现场出现反光零件、遮挡和高速运动,你会怎样设计 OOD 指标、fallback、动作限幅和再训练验收?请分别写出训练内性能、边界外拒绝率和真实设备安全证据。
一、强化学习与控制:同一个问题的两种语言
它们研究的是同一件事,只是传统不同:
| 控制 | 强化学习 |
|---|---|
| 状态 \(x\)、输入 \(u\) | 状态 \(s\)、动作 \(a\) |
| 代价 \(J\)(最小化) | 回报 \(R\)(最大化) |
| 对象模型 | 环境/转移概率 |
| 最优控制、HJB 方程 | Bellman 方程、值函数 |
| LQR | 线性二次情形的解析解 |
Bellman 方程与 HJB 方程是相关但不相同的动态规划方程(第十七页):Bellman 常写离散时间递推,HJB 是连续时间极限/连续时间最优控制的偏微分方程;在相应正则性、动力学和代价假设下可以互相对应。控制与 RL 也不是“有模型/无模型”的二分:控制可以做数据驱动设计,RL 也可以使用模型;真正要比较的是信息来源、目标、约束和可验证保证。
一个常被忽略的历史事实:动态规划(Bellman,1950 年代)同时是两个领域的源头。"强化学习是新东西"是一种错觉——新的是深度网络作为函数逼近器,以及由此带来的规模。
二、主要路线
① 无模型 RL(model-free):直接从交互中学策略(PPO、SAC 等)。
- 优点:不需要模型;
- 关键代价:许多深度无模型方法需要大量交互,数量级随任务、初始化、离线数据和算法而变。仿真可以承受的探索,在昂贵或会损伤设备的真实系统上往往不可直接照搬,因此需要离线数据、仿真、约束探索或其他先验。
② 基于模型的 RL / 学习型 MPC:先从数据学一个动态模型,再用规划或 MPC 求解。
- 在模型可辨识、预测误差可界定且规划器计算可承受时,样本效率可能高于无模型路线;长时域误差和计算开销仍需实测;
- 与第十七、十八页直接接续:这本质上就是"辨识 + MPC",只是模型可以是神经网络;
- 难点:模型误差在长时域预测中累积;优化器会利用模型的错误(找到模型里存在、现实中不存在的"漏洞")——这是基于模型 RL 的典型失效模式。
③ 模仿学习 / 从演示学习:从人类示范中学策略。避开了奖励设计,但存在分布偏移问题(一旦偏离演示轨迹就进入没见过的状态),需 DAgger 等方法缓解。
④ 学习 + 传统控制的混合:在底层控制器、门控和约束已有独立证据的条件下,这通常是较易审计的一条路线——
- 用学习补偿模型残差(在物理模型基础上学一个修正项);
- 用学习做高层决策,底层仍用可验证的控制器执行;
- 用学习整定传统控制器的参数。 可能保留部分传统方法的稳定性/约束证据,同时获得数据的灵活性;学习残差、切换逻辑和模型失配仍需单独证明,不能自动继承稳定性。
三、sim2real:核心工程难题
真实交互昂贵,于是先在仿真中训练,再迁移到实物。但仿真与现实总有差距(reality gap):接触与摩擦模型不准、传感器噪声与延迟、执行器动态、材料参数。
主流缓解手段:
- 域随机化:训练时随机化物理参数、纹理、延迟,可能改善对所覆盖变化的鲁棒性——本质上是在用采样近似一族模型;它不等价于 \(H_\infty\) 范数界,也不保证未覆盖分布的行为;
- 系统辨识 + 仿真校准(第十八页);
- 真实数据微调;
- 保守的动作空间(限制策略输出范围)。
诚实的现状:sim2real 在运动控制类任务(足式机器人行走、无人机敏捷飞行)上已有相当扎实的成功;在接触丰富的精细操作(柔性物体、装配)上仍然困难,因为接触与形变的仿真本身就不准。
四、为什么工业采用缓慢【争】
这是本页最需要诚实的部分。学习型控制在论文与演示中成果惊人,但在工业控制中的实际部署仍然有限,原因具体:
① 无稳定性与安全保证:神经网络策略难以给出第十五页那样的 Lyapunov 证明。在会伤人或损失巨大的系统上,"通常有效"不足以投运(承第十四页功能安全:需要的是可论证的保证)。
② 分布外行为不可预测:遇到训练中未出现的工况,行为可能任意。而工业系统的价值恰恰体现在异常工况下仍然安全。
③ 可验证性与认证:第十四页说过,安全相关软件依赖流程与验证。针对特定行业已有运行时监控、受限功能、仿真/试验覆盖和保证案例等路线,但对高维学习策略还没有一套跨行业、一次适用的通用认证答案;模型更新与变更管理尤其需要单独论证。
④ 数据获取昂贵:工业设备不允许大量试错,且故障数据天然稀缺。
⑤ 可维护性:现场工程师能调 PID,但无法调一个神经网络(承第十三、十六页反复出现的同一约束)。
⑥ 与现有方法的比较常不公平:许多论文把学习方法与未经认真整定的 PID 比较。精心整定的传统控制器往往比宣传的更强——这是判读此类工作时最该警惕的一点。
判读一篇学习型控制论文的清单:
- 是仿真还是真实硬件?
- 与认真整定的传统方法比了吗?
- 需要多少交互样本?
- 分布外与故障工况测试了吗?
- 有无安全保证机制?
五、真正有前景的落点
不是"取代 PID",而是几个传统方法确实力不从心的地方:
- 难以建模的对象:柔性体、颗粒物料、复杂流体、生物过程;
- 高维感知输入:直接从视觉到动作(传统控制难以处理图像输入);
- 多任务与泛化:一个策略适应多种工况,减少逐一调试的工程量;
- 参数自整定:用学习自动完成过去靠人的整定工作——这可能是最快落地的一类,因为它保留了传统控制器结构(可验证),只把整定自动化;
- 异常检测与预测性维护:不直接接管闭环时通常更易隔离风险;截至本页核对于 2026-07,它们在公开案例中较常见,但部署收益仍取决于误报、漏报、数据质量和处置流程。
注意最后两条的共同特征:把学习放在闭环之外或结构之内,而非让它直接接管闭环。 这与第十八页"工业偏好增益调度胜过在线自适应"是同一个逻辑——可验证性优先。
六、要点
- RL 与最优控制共享动态规划思想(离散 Bellman 与连续 HJB 有条件地对应),新方法的差异还在数据、函数逼近与验证接口;
- 无模型 RL 往往需要大量交互,真实设备上是否可行取决于样本、损坏代价和安全探索机制;基于模型的方法在模型质量和计算预算足够时可能更省样本;
- 混合路线(学习补偿 + 传统控制执行)便于分层审计,但稳定性不能自动继承;
- sim2real 可用域随机化等手段覆盖指定变化,不能替代真实设备边界测试;
- 工业采用受限于安全保证、可验证性与可维护性,而非性能;
- 最快落地的是"闭环之外"的应用(自整定、异常检测)。
下一页:如果要让学习型控制器真正进入安全关键系统,就必须回答一个问题——如何在保留灵活性的同时,给出可证明的安全保证?