第 5 章 · 策略梯度、Actor-Critic 与 PPO:直接优化策略 章节摘要:前四章都在学"价值"——先估出每个动作值多少分,再挑分高的。本章换路线:跳过价值,直接把策略写成带参数的函数 π(a|s;θ),用梯度上升让期望回报变大。REINFORCE 是最小实现,方差大到难以实用;基线与优势函数降噪;Actor-Critic 把学策略与学价值拧成一股绳;PPO 给策略更新装上限速器,成为今天工业界使用最广的强化学习算法;… 会员。《第 5 章 · 策略梯度、Actor-Critic 与 PPO:直接优化策略》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。