6.7 安全强化学习:约束与风险规避 本节摘要:把"别撞人、别爆仓、别过热"写进强化学习,标准的期望回报最大化不够用——它允许"平均赚钱但偶尔爆仓"。安全强化学习(Safe RL)给出三种形式化:约束马尔可夫过程(硬约束期望代价)、风险敏感目标(管尾部不管均值)、安全层兜底(运行时过滤危险动作)。本节讲清三者的数学形态、适用边界,以及"探索本身就是风险"这个无模型方法特有的安全难题。 会员。《6.7 安全强化学习:约束与风险规避》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。