内容摘要
强化学习做交易 · 为什么多半亏 灏 灏天文库 · 量化进阶·组合与机器学习 第 3 期 量化进阶 · 组合与机器学习 · 第 3 期 RL 做交易, 多半亏 ? reinforcement learning in trading · why it usually fails PPO 在 Atari 上吊打人类,搬到 A 股上多半亏成狗。不是算法不行,是 问题结构变了 :奖励稀疏、状态非平稳、过拟合样本、忽略成本。一句话—— 游戏规则固定,市场规则会变 ,RL 学的是过去,赚的是未来,这俩对不上。 ⏱ 约 12 分钟 🎯 想用 RL 做策略的人 📦 源:sunday-quant-scientist 01 反共识:RL 不是"自动赚钱",是"自动过拟合" "让 agent 自己学怎么交易"听起来很美。问题是它学到的往往不是市场规律,而是 训练集的偶然规律 。 Atari 的规则 30 年不变,agent 玩 1 亿次还是同一个游戏。市场不是——2015 和 2024 的微观结构完全不同,agent 在 2015-2020 学到的策略,2021 后大概率失效。