6.7 安全强化学习:约束与风险规避


文档摘要

6.7 安全强化学习:约束与风险规避 本节摘要:把"别撞人、别爆仓、别过热"写进强化学习,标准的期望回报最大化不够用——它允许"平均赚钱但偶尔爆仓"。安全强化学习(Safe RL)给出三种形式化:约束马尔可夫过程(硬约束期望代价)、风险敏感目标(管尾部不管均值)、安全层兜底(运行时过滤危险动作)。本节讲清三者的数学形态、适用边界,以及"探索本身就是风险"这个无模型方法特有的安全难题。 会员。《6.7 安全强化学习:约束与风险规避》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U