LQR:状态反馈怎么一次给完增益
WARNING
🧪 Beta公测版本提示:教程主体已完成,正在优化细节,欢迎大家提Issue反馈问题或建议。
PID 看的是一个误差标量。状态空间 已经把植物写成
。本章只讲:LQR 怎样用 一次给出 。demo 仍把卡尔曼串在同一条双积分器上(只测带噪位置),因为分离原理要同时看见「增益」和「估计」;滤波器本身见 卡尔曼。倒立摆是图解里的直觉对象。
一、状态空间
线性时不变植物:
: 维内部状态(倒立摆常取 ); :控制; :能测到的量,往往比 短——比如只测位置,速度得估。

图解说明:上半是
、 的方块;中段用倒立摆说明「状态可以比输出更长」;下段天平是 LQR: 罚状态偏离, 罚控制能量。
动画说明:双积分器小车
。左: 带着初速飞走;右: 拉回原点。 与 demo 相同。
离散时间(demo 用这个,因为电脑按步走)把
双积分器
无控制时位置匀速漂走——这就是「为什么需要反馈」的最小例子。机械臂要把这套接到关节,见 运动学 与 动力学。
二、LQR:一次求出增益
无限时域二次代价(连续写法便于记;实现是离散 Riccati)
最优反馈在线性植物上是

图解说明:代价
。 大讨厌偏差, 大讨厌用力。最优仍是线性反馈 。
逐步推导:双积分器离散 以及「为什么最优是线性反馈」(点击展开)
连续
写成
无限时域二次
三、卡尔曼:预测再修正
传感器只给

图解说明:蓝框按模型走一步,
,协方差变大;绿框用新息 和卡尔曼增益 把估计拉向测量,椭圆变小。 决定信模型还是信测量。
循环是:
- 预测
, ; - 更新
,再用残差修正 与 。
这和 世界模型 里「先验动力学 + 用观测纠正隐状态」是同一句人话;RSSM / 卡尔曼只是线性高斯时有闭式。量子侧把「测完如何更新信念」换成另一套语言,见 量子信息。
四、代码在做什么
demo.py 三条轨迹同一套离散双积分器:无控制、全状态 LQR(直接用真

无控制会漂;全状态 LQR 最快按回原点;带滤波的 LQR 稍吵、稍慢,但不再需要测速度。增益
五、小结
| 概念 | 一句话 |
|---|---|
| 状态 | 预测下一步所需的内部向量 |
| LQR | 二次代价下的 |
| 卡尔曼 | 预测放大不确定,测量再收缩 |
| 分离原理(直觉) | 线性高斯时,可先滤波再套 LQR |
| 下游 | 机器人、飞行器;学出来的动力学见世界模型 |
📥 Code
| File | View | Download |
|---|---|---|
| demo.py | Open | Download |
| exercise.py | Open | Download |