1.2 控制论另一条主线:反馈如何驯服系统


1.2 控制论另一条主线:反馈如何驯服系统

本节摘要:控制论研究"如何让系统在扰动下自动维持期望行为",其核心机制是反馈——持续观测偏差、按规则纠正。本节用烤箱温控的仿真对比开环与闭环的差异,展示反馈的威力与代价(震荡、噪声放大、时滞失稳),并说明运筹与控制两条主线在马尔可夫决策过程中的会师。

一个没有厨师盯着的烤箱

还是那间面包房,这次的问题换了个性质:烤箱要稳定在 180 度。最省事的方案是"开环控制"——查一张经验表,环境 25 度、目标 180 度,加热管通电 8 分钟。听起来可行,但门被开了一次、室温降了十度、电压波动了 5%,表格全部作废。开环的命门在于:它对世界的假设一旦被扰动打破,就没有任何自我修复能力。

闭环控制的思路朴素得多:装一个温度计,每秒读一次温度,比 180 度低就加热,高就停。观测偏差、按规则行动、再看新偏差——这个循环就是反馈。1948 年维纳在《控制论》里把它提炼成一门普适学科时,举的例子从火炮随动系统一直讲到神经反射,核心主张只有一句:面对不确定的世界,与其预测一切,不如边走边纠。

用仿真对比开环与闭环

把烤箱简化成一阶惯性系统:温度变化率正比于"加热功率减去散热"。下面的代码同时跑开环(固定功率)与闭环(按偏差比例加热)两种策略,并加入一次开门扰动:

import numpy as np T_target, dt, steps = 180.0, 0.1, 600 def simulate(closed_loop=True, Kp=0.8): T, hist = 25.0, [] for k in range(steps): disturb = 30.0 if 300 <= k < 330 else 0.0 # 第30秒有人开门放冷气 if closed_loop: power = Kp * (T_target - T) # 比例反馈 else: power = 4.5 # 查表得到的固定功率 dT = (power - 0.025 * (T - 25.0) - disturb) * dt T += dT hist.append(T) return np.array(hist) open_loop = simulate(closed_loop=False) close_loop = simulate(closed_loop=True) print(f"开环末温 {open_loop[-1]:.1f},扰动期间最低 {open_loop[300:330].min():.1f}") print(f"闭环末温 {close_loop[-1]:.1f},扰动期间最低 {close_loop[300:330].min():.1f}")

开环与闭环的温度轨迹对比

开环与闭环的温度轨迹对比

跑出来的结果很有代表性:开环在无扰动时勉强逼近目标,一次开门就把温度打落十几度且永远回不到 180;闭环在扰动后几个采样周期内就重新收敛。反馈的威力不在"算得准",在"错了能回来"。

但反馈不是免费午餐。把增益 Kp 从 0.8 一路加到 20 再跑一次:温度开始围绕 180 度剧烈震荡——增益太大,纠正动作过猛,系统在"过冲—反纠—再过冲"里打摆。这是所有反馈系统的第一个宿敌:稳定性与响应速度的权衡。第二个宿敌是噪声:如果温度计每次读数带随机误差,比例反馈会把噪声原样放大到加热管上;第三个宿敌是时滞:温度计若延迟 5 秒才上报,中等增益也可能引发震荡。这三个现象分别通往第 7 章的稳定性分析、第 8 章的卡尔曼滤波(对付噪声)与频域方法(对付时滞)。

会师点:从反馈到序贯决策

读到这里你可能觉得,运筹学讲"算一次"、控制论讲"一直调",井然分明。但回头看 1.1 的面包房:如果每天的补货量不是一个孤立决策,而是"根据今天的库存偏差和明天的需求预测滚动调整"的规则,它就已经是闭环。形式化这条思路的数学对象是马尔可夫决策过程(MDP):状态、动作、转移、奖励四件套,既可以是控制论文里的随机最优控制问题,也可以是强化学习里智能体的训练环境。1957 年贝尔曼提出动态规划方程时,两条主线事实上已经打通;1990 年代之后的强化学习热潮,只是让这场会师变得家喻户晓。第 8 章第 3 节会沿着这条线走完全程。

💡 关键直觉:运筹学把不确定性当作用来建模的参数,控制论把不确定性当作需要被反馈吞噬的敌人。前者追求一次性算对,后者追求持续不错。

反馈无处不在:三个身边的例子

把反馈的镜头转向身边,你会发现它是文明的基础设施之一。马桶水箱:浮球随水位升降开合进水阀——机械式纯比例反馈,一百多年前的设计至今在每间卫生间里忠实执行"观测偏差、纠正水位"。人体血糖:胰岛细胞感知血糖浓度分泌胰岛素与胰高血糖素,是一套精密的双向反馈;糖尿病的本质是这条回路的执行器衰竭,外源胰岛素相当于开环补控制量——这正是人工胰腺(闭环胰岛素泵)研究要重新闭合的回路。宏观经济:央行盯通胀与就业调整利率,同样是最典型的反馈结构,而政策时滞带来的震荡难题,与烤箱时滞引发的温度震荡在数学上同构。三个例子横跨机械、生物、社会三个领域,结构却完全一致——这正是维纳当年宣称控制论是"关于机器与生命的普适科学"的底气。识别反馈结构的能力,是本教程希望你带走的第一副眼镜:看到任何稳定运转的系统,先找它的传感器、比较器和执行器。

本节要点回顾

  • 反馈 = 观测偏差 + 按规则纠正,其价值是对扰动和模型误差的自动免疫;
  • 开环依赖预测,闭环依赖纠正:世界越不可测,闭环越占优;
  • 反馈三宿敌:高增益震荡(稳定性)、测量噪声被放大、时滞引发失稳;
  • 烤箱仿真可复现:改 Kp、改扰动、改时滞,观察曲线形态变化,是理解第 7、8 章最便宜的实验台;
  • MDP 是两条主线的会师点:序贯决策 + 状态转移,一头连着随机控制,一头连着强化学习。

本章两张沙盘都摆好了。下一章回到运筹学战线,学习画沙盘的基本功:怎么把一句"我想省钱"翻译成变量、约束和目标。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U