2.4 半监督学习与强化学习:标签稀缺与奖励驱动


2.4 半监督学习与强化学习:标签稀缺与奖励驱动

本节摘要:监督与无监督之外,现实还备着两种极端工况。一种是标签贵得离谱:医学影像要资深医师逐张标注,互联网上的图片却近乎免费——少量标签加海量无标签,逼出了半监督学习,靠平滑、聚类、流形三大假设和伪标签、协同训练等手段把免费数据用起来。另一种是连"一问一答"都不存在,只有一个延迟的分数:智能体在环境里试错,靠奖励信号自己摸出策略,这是强化学习。本节讲清两位非常规老师的工作机理与代表算法。关键词:伪标签、一致性、智能体、奖励、探索与利用、Q 学习。

本节导读

  1. 说清半监督学习被什么成本压力逼出来,以及它能成立靠哪三大假设;
  2. 描述自训练、协同训练、图方法、一致性正则各自的路数与风险;
  3. 数出强化学习的核心要素,解释折扣因子为什么非有不可;
  4. 区分基于价值、基于策略、Actor-Critic 三大家族,说清探索与利用的两难。

一、标签经济学:半监督学习的补位

先算一笔账。给一张肺部影像标注病灶,要占用放射科医生几分钟;标注百万张,就是好几个医生年的工作量,医院出不起这个钱。反过来看,互联网上的图片、网页、语音漫山遍野,抓下来几乎不要钱。一边是贵得离谱的答案,一边是免费的问题——监督学习只要前者,无监督学习只碰后者,两头都浪费。半监督学习的立足点就钉在这道价差上:用少量标注数据起个头,再让海量无标注数据帮着把模型喂大。实验反复验证,只要方法得当,加了无标注数据的模型确实比只啃少量标签的模型更准。

无标注数据凭什么帮得上忙?因为它透露了数据自身的地形。半监督学习能成立,背后站着三条假设。平滑性假设说,特征空间里挨得近的样本,标签大概率相同——邻居是同类。聚类假设说,数据天然成簇,同一个簇共享一个标签,因此决策边界应当穿过数据的稀疏地带,别从人堆里横穿马路。流形假设说,高维数据其实趴在一个低维流形上,无标注数据能把这张地形的褶皱描得更细,模型看清了地形,画边界自然更准。三条假设一句话:先信数据有结构,再让结构替标签说话。

方法谱系里,最直观的是自训练。先用少量标注数据训出初始模型,让它给海量无标注数据打分,把预测置信度最高的那批挑出来贴上"伪标签",并入训练集重新训练,循环往复。风险也写在脸上:初始模型犯的错会借着伪标签混进训练集,越滚越偏,这叫误差累积。协同训练想用互相监督来对冲:假设数据天然有两个视图,比如一张网页既有页面文本又有超链接结构,两个视图各自训练一个分类器,各自挑出有把握的伪标签,喂给对方当教材。两个视图互相纠错,比单打独斗稳当,前提是视图之间确实充分且条件独立——这个前提现实里经常打折扣。基于图的方法把全体样本连成一张图,节点是样本,边是相似度,标注样本的标签沿着边向邻居传播,标签传播算法是这一路的代表,局部与全局结构都用得上,代价是图建大了内存和计算都吃不消。一致性正则则是深度学习时代的思路:对同一个无标注样本施加两种扰动——加噪声、做数据增强之类——要求模型两次给出的预测保持一致,模型因此学到对扰动不敏感的表示,本质上是把平滑性假设做成了训练目标。

落地场景全是"标注贵"重灾区:网页与新闻的文本分类,标注的只有零头,语料却天天在涨;语音识别的声学模型,录音遍地都是,逐句转写要人命;基因序列与蛋白质结构的功能标注,非专业团队碰不了;欺诈检测里正常交易海量、欺诈样本稀少,标签还得跟着骗术演变不断更新。

⚠️ 常见坑:伪标签的确认偏误。模型早期在某一类样本上系统性出错,自训练会把这些错误高置信度地复制放大,形成"越学越信自己"的死循环。工程上的保险丝:伪标签只挑置信度最高的一小撮、每轮限制并入量、定期用人工抽检校准。

💡 关键直觉:半监督像"几口确认井加一片地震剖面"。井少而贵,提供准确的深度标定;地震剖面便宜量大,提供全区构造形态。用井标定剖面,再拿剖面外推无井区块——勘探队几十年的日常,正是半监督学习的老本行。

二、把决策交给试错:强化学习的要素表

换个工况。让机器人学走路,没人能给出"第 0.3 秒左膝弯 17 度"这样的标准答案;下棋更是,一步棋的好坏要到终局才见分晓。这类序贯决策任务,监督学习的"一问一答"框架根本套不上——于是强化学习换了个老师:奖励。

强化学习的舞台只有两个角色:智能体与环境。智能体观察当前状态,按策略选一个动作执行;环境接住动作,回赠两样东西——新的状态和一份数据化的奖励,正为鼓励,负为惩罚。如此往复,直到回合结束。智能体唯一的目标是让长期累积奖励最大,注意是长期:为了将来的大奖励,眼下吃点小亏是常事。

这套循环的行话可以列成一张要素表:状态是环境此刻的描述;动作是智能体能做的事;奖励是即时的分数;策略是状态到动作的准则,学习的最终产物就是它;价值函数往前看,估计从某状态出发、或在某状态做了某动作之后,往后还能攒下多少累积奖励——状态价值函数与动作价值函数各管一摊,后者常被称为 Q 函数,是众多算法的心脏。

累积奖励怎么算,绕不开折扣因子。未来的奖励要乘上一个介于 0 和 1 之间的折扣再累加:折扣接近 0,智能体目光短浅,只顾眼前;接近 1,它愿意为远期利益隐忍。没有折扣,无穷回合的奖励加起来发散,账就没法算了。整套问题在数学上被整理成马尔可夫决策过程,五个要素——状态集、动作集、状态转移规律、奖励规律、折扣因子;它要求的马尔可夫性质只有一句话:当前状态已含决策所需的全部历史,明天只看今天,不必翻旧账。价值函数之间的递归关系由贝尔曼方程给出:一个状态的价值等于即时奖励加上后继状态折扣后的价值——评估、回溯、再评估,动态规划的味道扑面而来,这一递归正是绝大多数强化学习算法的更新骨架。

真正的两难在探索与利用。眼下有个动作平均得分不错,是接着用(利用),还是试试没做过的动作,赌它得分更高(探索)?只利用,可能一辈子困在平庸解;只探索,等于永远交学费不收成。油气勘探把这组矛盾演得最直白:在已证实油田里加密开发井,产量稳当;到新区打探井,可能颗粒无收,也可能摸到大油气田。一个公司的钻探预算怎么在两者之间分配,和智能体的 ε-贪婪策略——以小概率 ε 随机探索、其余概率选当前最优——是同一道题。上限置信界 UCB 则更精打细算:优先试"尝试次数少、不确定性大"的选项,赌的是不确定性背后藏着惊喜。

三、门派与战例:从表格算法到深度强化学习

算法怎么分类,看它学的是什么。基于价值的一路学 Q 函数,用时挑价值最大的动作,代表是 Q 学习与 SARSA;基于策略的一路绕开价值、直接学策略本身,代表是策略梯度家族的 REINFORCE;Actor-Critic 把两路合璧,演员负责出动作,评论家负责打分并指导演员改进,A2C、A3C、DDPG、PPO、SAC 都出自这一门。另一条切分线是学不学环境模型:基于模型的一路先把环境的状态转移和奖励规律学下来,再在脑内推演规划,蒙特卡洛树搜索是代表;无模型的一路不建模型,硬靠真实交互学,样本效率低但免去了建模误差。还有一条线看数据来源:Q 学习是离线式,学最优策略却可以用别的策略产生的数据,旧经验能反复回锅;SARSA 是在线式,学什么策略就用什么策略的数据,看到的世界即真实的世界。

Q 学习的更新规则用一句话能讲完:拿到一次"状态、动作、奖励、新状态"的经历后,把该状态动作对的 Q 值朝"即时奖励加新状态下最大 Q 值的折扣和"的方向挪一小步,步长由学习率控制。SARSA 只改一个词:不用新状态下的最大 Q 值,用下一步按当前策略实际要执行的动作的 Q 值。一词之差,性格迥异——Q 学习眼里只有最优路线,敢抄险路;SARSA 带着自己可能的失误一起评估,走得保守。在悬崖边走路,SARSA 会离崖远一点。

深度学习进场之后,Q 表换成了神经网络:状态喂进去,各动作的价值吐出来,这就是 DQN。神经网络负责从像素这类高维状态里提炼特征,强化学习框架负责在试错中改进策略,两者嫁接成深度强化学习。战例一串:AlphaGo 把策略网络、价值网络与蒙特卡洛树搜索拧在一起拿下围棋,其后续版本更从零开始自我对弈,摆脱了对人类棋谱的依赖;AlphaStar 在星际争霸这类不完全信息、动作空间庞大的游戏中达到职业水准;OpenAI Five 在 Dota 2 里击败世界冠军战队。离开牌桌也一样能打:数据中心用强化学习调度冷却系统,把冷却能耗压降了约四成——这是电网调度气质最浓的一战,制冷设备何时开、开多大,全靠智能体在电费与温度之间自己权衡;机器人用它学抓取与步态,自动驾驶拿它做行为决策,物流与金融拿它做序列优化,推荐系统拿它兼顾短期点击与长期留存,药物研发拿它搜索分子结构。

应用领域 代表案例 强化学习管的事
游戏 AlphaGo、AlphaStar、OpenAI Five 自我对弈中磨策略
能源与调度 数据中心冷却、电网调度 在成本与约束间做序列决策
机器人 抓取、行走、导航 高频控制信号的学习
交通 自动驾驶决策、信号灯配时 长时程行为规划
金融与电商 交易策略、推荐系统 收益与风险的长期权衡
科学研究 分子结构搜索 巨大组合空间里的探索

⚠️ 常见坑:奖励设计被钻空子。奖励只是目标的代理,智能体优化的是你写的分数,不是你心里的愿望。清扫机器人若按"捡到垃圾加分"设计,它可能学会把垃圾倒出来再捡;游戏智能体若按杀敌数给分,它可能赖在刷怪点不走。代理目标与真实目标错位,智能体越聪明,钻空子钻得越欢——定奖励,要像定合同条款一样抠字眼。

💡 关键直觉:强化学习的老师只有一个分数,且总是迟到。监督学习每道题当场对答案,强化学习要到终局才结总分,中间每一步的功过都得靠价值函数回头分账。延迟的奖励是这个范式的宿命,也是它难学的根源。

常见问题

强化学习一定要配深度网络吗? 不必。状态和动作都可枚举的小问题,一张 Q 表配上 Q 学习更新就能解,经典教材里的网格世界走迷宫就是例子。深度网络是给高维状态准备的函数逼近器,属于放大器而非发动机。

什么时候半监督反而不如纯监督? 三大假设不成立的时候。若决策边界恰好要从数据密集区穿过去(聚类假设失效),或者少量标注数据的分布与无标注数据脱节,无标注数据帮不上忙还添乱。上手段之前,先验一验假设,跟开工前先做物探是一个道理。

要点速记

  • 半监督学习的动力是标签经济学:标注贵、无标注免费,少量标签起头、海量无标注数据喂大,是这条路线的全部理由。
  • 三大假设是地基:平滑性、聚类、流形——先信数据有结构,结构才能替标签说话。
  • 四大手段各有风险:自训练怕误差累积,协同训练要双视图独立,图方法吃内存,一致性正则把平滑假设做成训练目标。
  • 强化学习的舞台是智能体与环境的状态、动作、奖励循环,策略是最终产物,价值函数负责往前算长期账。
  • 折扣因子介于 0 和 1 之间,既压住无穷和的发散,也校准智能体的远见。
  • 马尔可夫决策过程五要素加贝尔曼递归,是全部算法的数学骨架:当前状态已含决策所需全部历史。
  • 探索与利用是根本两难,ε-贪婪与 UCB 是两种折中,勘探队"打探井还是加密井"与之同构。
  • 门派三足鼎立:基于价值、基于策略、Actor-Critic;切分线还有有无环境模型、数据在线离线。DQN 之后,神经网络成了高维状态的标配。
  • 奖励是唯一的老师,也是最容易被钻空子的合同——代理目标与真实目标错位,智能体会把空子钻到底。

四种范式凑齐,模型也训出来了,可凭什么说一个模型比另一个好?下一节把所有产物放上同一架天平——混淆矩阵当砝码,交叉验证当秤杆,过拟合当头号嫌疑人。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U