第 6 章 · 01 LLM 量化:TradingAgents 与 RD-Agent 本节摘要:本节梳理 quant-wiki docs/ai 下两类代表性 LLM 量化工具。第一类是多智能体交易框架 TradingAgents:借鉴真实交易公司组织结构,设置基本面、情绪、新闻、技术四类分析师 + 多空研究员辩论 + 交易员决策 + 风险经理审批的五层管线,用「结构化报告 + 自然语言辩论」混合通信,在 AAPL/GOOGL/AMZN 等股票上累计收益、夏普比率、最大回撤均显著超越 B&H、MACD、KDJ&RSI、ZMR、SMA 等基准。
本节摘要:本节梳理 quant-wiki docs/ai 下两类代表性 LLM 量化工具。第一类是多智能体交易框架 TradingAgents:借鉴真实交易公司组织结构,设置基本面、情绪、新闻、技术四类分析师 + 多空研究员辩论 + 交易员决策 + 风险经理审批的五层管线,用「结构化报告 + 自然语言辩论」混合通信,在 AAPL/GOOGL/AMZN 等股票上累计收益、夏普比率、最大回撤均显著超越 B&H、MACD、KDJ&RSI、ZMR、SMA 等基准。第二类是LLM 自动获取策略 + RD-Agent 范式:用 LLM 从论文、财报、图表等多模态素材中挖掘种子 Alpha,再由多代理按风险偏好打分、回测、动态调权。本节讲清两类工具的定位、架构、适用场景与落地难点,既看到 LLM 的潜力,也提示数据泄露、可重复性、成本等风险。素材来自 docs/ai/aiquant。
内容来源:quant-wiki docs/ai/aiquant(TradingAgents、如何利用 LLM 自动获取量化投资策略),知识结构化整理。
⚠️ 学习提示:LLM 量化是「放大器」——既放大研究效率,也放大过拟合与数据泄露的风险。任何 LLM 给出的策略在投产前都必须经过独立的样本外回测与逻辑审查,不要被「累计收益 53%」这类数字冲昏头脑。
阅读完本节,你应当能够:
近年大语言模型(LLM)在金融领域的应用大致分三种定位:
| 定位 | 输入 | 输出 | 代表项目 |
|---|---|---|---|
| 研究员助手 | 论文、财报、新闻 | 摘要、因子清单、研报 | FinRobot、RD-Agent 范式 |
| 直接交易员 | 行情、新闻、情绪 | 买卖指令 | FinMem、FinAgent、TradingAgents |
| Alpha 挖掘机 | 多模态文献、数据 | 公式化 Alpha 因子 | QuantAgent、AlphaGPT、Seed Alpha Factory |
💡 关键观察:TradingAgents 与 Alpha 工厂分别代表「自下而上做单只股票决策」与「自上而下挖因子组合」两条路径。前者更像传统 discretionary trader 的 AI 化,后者更像 quant researcher 的 AI 化。
TradingAgents 借鉴真实交易公司的组织,设置七种角色:
TradingAgents 的一个核心创新是不只用自然语言聊天。它采用「结构化报告 + 自然语言辩论」混合通信:
💡 设计动机:纯自然语言聊天在多轮对话后会出现「串线效应」——信息丢失或变形。结构化报告保证关键信息不丢,自然语言辩论保留了对复杂问题的开放探讨。这一设计对长周期、多角色的金融决策尤其重要。
TradingAgents 混合使用两类 LLM 控制「深度/速度」平衡:
| 模型类型 | 例子 | 用途 |
|---|---|---|
| 快思 | gpt-4o-mini、gpt-4o | 摘要、数据检索、表格转文字 |
| 深思 | o1-preview | 多轮推理、决策、长文本报告 |
分析师、研究员、交易员节点用深思模型保证决策质量;工具与 API 调用用快思模型提升效率。这种「混合大脑」让框架无需 GPU、只用 API 即可运行,也方便将来接入更强的推理模型或金融专用模型。
TradingAgents 在 2024 年 1-3 月的回测中,AAPL/GOOGL/AMZN 上累计收益分别达 26.62%、24.36%、23.21%,夏普比率均超 5.6,最大回撤控制在 2 左右,显著优于 B&H、MACD、KDJ&RSI、ZMR、SMA 等基准。
| 指标 | AAPL | GOOGL | AMZN |
|---|---|---|---|
| 累计收益 CR% | 26.62 | 24.36 | 23.21 |
| 年化收益 ARR% | 30.5 | 27.58 | 24.90 |
| 夏普 SR | 8.21 | 6.39 | 5.60 |
| 最大回撤 MDD% | 0.91 | 1.69 | 2.11 |
⚠️ 陷阱:回测区间仅 3 个月、标的仅 3 只美股大盘股,样本极小。「优于基准」的结论在统计上不稳健——任何策略在牛市里都容易漂亮。论文作者也承认未来要在实盘与更长时间跨度验证。读者务必把这类结果当作「概念验证」而非「可投产业绩」。
如何利用 LLM 自动获取量化投资策略 描述了一个完整的「种子 Alpha 工厂」,分三阶段:
(CLOSE - DELAY(CLOSE,14))、STD(CLOSE, 20)。该框架在上证 50 成分股上测试,2023 年测试集累计收益 +53.17%,同期上证 50 指数 -11.73%。两个代表性 Case 显示框架能「针对不同市场情形灵活选出 Alpha」:
「RD-Agent」代表一种更广义的研究自动化范式:LLM 同时扮演「writer 代理」(基于 trader 想法生成脚本)、「judge 代理」(反馈与评分)、在真实市场回测迭代。QuantAgent、AlphaGPT 等项目都采用类似的双循环(inner-loop/outer-loop)架构,核心思想是让 LLM 在「生成—评估—迭代」的闭环里自动改进策略,而非一次性产出。
💡 关键区分:TradingAgents 是「替代交易员做决策」(端到端下单),Alpha 工厂是「替代研究员挖因子」(产出可复用因子)。前者更像 AI trader,后者更像 AI researcher。实务中后者更容易落地——因子是「半成品」,可被人工审核;下单决策是「成品」,错了直接亏钱。
LLM 的训练数据可能已包含历史行情、财报甚至论文结论。让它「分析 2020 年某股票」时,它实际上可能「记得」2021 年之后该股票的走势,造成隐性数据泄露。回测时务必确认 LLM 的输入只有「当时可得」的信息。
多智能体框架要调用数百次 LLM API,成本高昂(每日决策可能花数十美元),延迟显著(几分钟到几十分钟)。这对高频策略不现实,只适合日频或更低频的决策。
LLM 输出有随机性(温度参数 > 0),同一输入可能给不同决策。回测结果难以精确复现,这与传统量化「代码确定性强」的特点冲突。实务中常设温度=0 或多跑取中位数,但仍非完全确定性。
LLM 善于「事后编故事」——给它一段历史,它能给出看似合理的解释。这种能力在因子挖掘里反而是陷阱:可能把噪声当信号。Novy-Marx 称之为 HARKing(先看结果再编假说)的「工业化」风险。
⚠️ 风险清单:数据泄露、成本延迟、可重复性、过拟合、合规(LLM 决策的法律责任归属)——LLM 量化的五大风险。任何投产前都要做独立的样本外验证与人工审查。
基于以上分析,LLM 量化并非万能,它在以下场景更有价值:
相对地,以下场景 LLM 不适合:高频交易、单点个股短期预测、需要严格确定性的策略。
下一节,我们看 LLM 的另一面:GPT 选股与情感分析,从新闻、财报、社媒文本里提炼交易信号。