第 6 章 · 03 强化学习:TradeMaster、FinRobot、InvestorBench 本节摘要:本节梳理 quant-wiki docs/ai/aiquant 下三个有代表性的「AI 智能体 + 强化学习」项目。TradeMaster 是面向量化交易全流程的开源 RL 平台,把交易建模成 MDP,提供 13+ 种 RL 算法(EIIE、DeepScalper、SARL、PPO 等)、多市场数据集(美股/港股/A 股/加密/期货)、PRIDE-Star 雷达图评估。FinRobot 是首个专为股票研究设计的多智能体 CoT 框架,设 Data-CoT、Concept-CoT、Thesis-CoT 三层代理,自动产出卖方级研报。
本节摘要:本节梳理 quant-wiki docs/ai/aiquant 下三个有代表性的「AI 智能体 + 强化学习」项目。TradeMaster 是面向量化交易全流程的开源 RL 平台,把交易建模成 MDP,提供 13+ 种 RL 算法(EIIE、DeepScalper、SARL、PPO 等)、多市场数据集(美股/港股/A 股/加密/期货)、PRIDE-Star 雷达图评估。FinRobot 是首个专为股票研究设计的多智能体 CoT 框架,设 Data-CoT、Concept-CoT、Thesis-CoT 三层代理,自动产出卖方级研报。InvestorBench 是面向多任务金融决策的 LLM 基准,基于 POMDP 建模,测试 13 种 LLM 在股票/加密/ETF 三类任务上的表现。三者分别代表「RL 做交易」「LLM 做投研」「LLM 做基准评测」三条路径,共同构成 AI 量化的工具图谱。素材来自 docs/ai/aiquant。
内容来源:quant-wiki docs/ai/aiquant(TradeMaster、FinRobot、InvestorBench),知识结构化整理。
⚠️ 学习提示:强化学习在交易里「回测容易、实盘难」——RL 策略对环境假设极敏感,在模拟器里学到的策略迁移到真实市场往往大幅退化。把 RL 结果当研究探索,而非直接投产。
阅读完本节,你应当能够:
强化学习(RL)把交易建模成序贯决策问题:智能体在每个时刻观察市场状态,选择动作(买/卖/持),获得奖励(收益),并在下一时刻面对新状态。目标是最大化长期折扣收益:
与传统监督学习「预测下一期收益」不同,RL 直接优化「长期累积收益」,理论上更贴近交易目标。但代价是训练不稳定、样本效率低、对环境(模拟器)保真度要求高。
💡 关键观察:RL 在交易里的核心难点不在算法,而在环境建模——奖励函数、交易成本、滑点、流动性约束都得在模拟器里如实刻画,否则学到的策略在实盘会失效。TradeMaster 把「高保真市场模拟器」列为六大模块之一,正是为此。
TradeMaster 把量化交易工作流拆成六大模块:
| 模块 | 内容 |
|---|---|
| 多模态市场数据 | 美股、港股、A 股、加密货币、期货,多种频率 |
| 数据预处理流水线 | 自动清洗、特征生成、Alpha158 技术指标 |
| 高保真市场模拟器 | 多种主流量化交易场景,含交易成本与冲击 |
| 13+ RL 算法 | EIIE、DeepScalper、SARL、DeepTrader、PPO、SAC、DDPG 等 |
| 系统化评估 | 6 个维度、17 种指标,PRIDE-Star 雷达图 |
| 多样化接口 | 满足科研与工程跨学科用户 |
TradeMaster 收录多种数据集,覆盖不同资产类别与频率:
| 数据集 | 来源 | 类型 | 频率 |
|---|---|---|---|
| S&P500、DJ30 | Yahoo | 美股 | 日 |
| SSE50 | Yahoo | A 股 | 日 |
| HS30 | AKShare | 港股 | 日 |
| Bitcoin | Binance | 加密 | 分钟(LOB) |
| Crypto | Kaggle | 加密 | 日 |
| Future | AKshare | 期货 | 5 分钟 |
这种多市场、多频率的覆盖,让 RL 算法可以在不同环境上对比验证,降低「只在一只标的上过拟合」的风险。
TradeMaster 的算法分两类:
不同算法适用不同任务:DeepScalper 适合日内高频,SARL/EIIE 适合组合管理,ETEO 适合订单执行。TradeMaster 提供 Colab 在线教程,每个算法配数据集与代码模板。
TradeMaster 用 PRIDE-Star 雷达图从 6 个维度、17 种指标评估 RL 策略,一图概览策略优劣。这种多维度评估比单一夏普比率更全面,因为 RL 策略常在某些维度(如收益)优秀但在另一些维度(如回撤、稳定性)较差。
⚠️ 陷阱:RL 策略对随机种子敏感,同一算法不同种子可能给出截然不同的结果。复现时务必多跑几个种子取统计量,不要被「最好那次」的回测迷惑。
FinRobot 与第 1 节的 TradingAgents 都是多智能体 LLM 框架,但定位不同:
| 维度 | FinRobot | TradingAgents |
|---|---|---|
| 定位 | 卖方研究(产出研报) | 交易决策(产出买卖) |
| 输出 | 投资评级、估值、风险分析 | 具体买卖指令 |
| 代理层 | Data/Concept/Thesis 三层 CoT | 4 类分析师 + 多空研究员 |
| 适用 | 投研辅助 | 自动交易 |
FinRobot 的核心创新是 Chain of Thought 的分层:
FinRobot 邀请投行分析师从三个维度对生成的研报打分:
专家评审与 GPT-4 自动评分基本一致,大多在准确度上给 9-10 分。稳定性测试显示 FinRobot 在三维度上均优于零样本、少样本、纯 CoT 提示。
💡 迁移提示:FinRobot 的三层 CoT 思路可推广到任何「数据密集 + 推理密集」的金融任务——先把数据做扎实(Data 层),再提炼概念(Concept 层),最后形成可执行的论点(Thesis 层)。这种分层比让单一 LLM「一步到位」更稳健。
InvestorBench 把金融决策建模成部分可观测马尔可夫决策过程(POMDP):状态空间分可观测部分(行情价格)与不可观测部分(市场心理),动作空间是 {Buy, Sell, Hold},奖励是每日盈亏。智能体由若干子模块构成:
InvestorBench 覆盖股票、加密货币、ETF 三类任务,每类配独立数据集:
| 任务 | 行情 | 文本 | 情绪 |
|---|---|---|---|
| 股票 | Yahoo OHLCV | SEC 10-Q/10-K | gpt-3.5-turbo 分类 |
| 加密 | CoinMarketCap | cryptonews 等多源 | gpt-3.5-turbo 分类 |
| ETF | NIFTY 数据集 | 新闻头条 | 已有情绪标签 |
InvestorBench 测试了 13 种 LLM(含闭源、开源、金融微调),核心发现:
💡 关键洞察:InvestorBench 的结论对模型选择有直接指导意义——选股选 ETF 优先闭源大模型,选加密至少要大规模开源或闭源,金融微调模型并非万能。
| 维度 | RL(TradeMaster) | LLM 智能体(TradingAgents/FinRobot) |
|---|---|---|
| 决策依据 | 数值策略(神经网络) | 语言推理 |
| 训练 | 需大量交互数据 | 零/少样本提示 |
| 可解释性 | 黑箱 | 自然语言可解释 |
| 实时性 | 毫秒级 | 秒到分钟级 |
| 适用 | 高频、组合管理 | 低频、研究辅助 |
两者并非互斥,趋势是融合:用 LLM 做高层决策(选什么标的、什么策略),用 RL 做底层执行(具体下单、组合权重)。TradeMaster 也在引入 FinAgent、EarnMore 等结合 LLM 的工作。
下一节,我们用 docs/ai 的综述与论文清单,梳理 AI 量化的全景图与学习路径。