强化学习做交易的陷阱 · TradeMaster pitfalls
RL 在游戏(Atari、围棋)里大杀四方,因为游戏有明确规则、即时反馈、可无限重放。金融恰好相反:
围棋规则几千年不变,agent 学一次管用。金融规则天天变,今天有效的明天失效。
市场是其他参与者博弈的结果,你学到了策略,别人也在学,策略一旦有效就被套利掉。
Atari 可以模拟几亿次。金融只有一份历史,且每个时刻只有一个样本,不能重来。
同一策略同一情境,结果随机性极大——盈亏里 90% 是噪声,agent 学到的是噪声不是信号。
所以 RL 在金融里要解决的核心问题不是"学得快",是"怎么在噪声里学到信号、且信号不会过期"。这比游戏难一个量级。
下面 8 个陷阱,勾选你(或你的 agent)踩过的,看你的 agent 还有救吗。致命级踩中 1 个基本就完蛋。
RL 的核心是奖励函数——它告诉 agent "什么好什么坏"。设计错了,agent 学到的不是你想要的。三个经典错误:
记住:agent 优化的是你给的奖励,不是你想要的利润。奖励函数和真实目标差一点,agent 就会找到那个差别的漏洞去钻。