第 8 章 · 04 LLM 因子挖掘与工具链 本节摘要:本节讲因子挖掘的最新前沿——大语言模型(LLM)因子挖掘。前几节的遗传规划与神经网络都基于「数值运算」,而 LLM(如 GPT-4、Claude)具备语义理解与代码生成能力,能从研报/论文中读取因子思路、生成因子定义与计算代码、自动跑回测、根据结果迭代,形成「LLM 提因子 → 写代码 → 回测 → 反馈优化」的闭环。代表项目包括 RD-Agent(微软,自动化研究与开发智能体)、AlphaAgent(KDD 2025,多智能体因子挖掘)、alpha-gfn(结合强化学习的因子搜索)、以及华泰的「GPT 因子工厂」多智能体方案。
本节摘要:本节讲因子挖掘的最新前沿——大语言模型(LLM)因子挖掘。前几节的遗传规划与神经网络都基于「数值运算」,而 LLM(如 GPT-4、Claude)具备语义理解与代码生成能力,能从研报/论文中读取因子思路、生成因子定义与计算代码、自动跑回测、根据结果迭代,形成「LLM 提因子 → 写代码 → 回测 → 反馈优化」的闭环。代表项目包括 RD-Agent(微软,自动化研究与开发智能体)、AlphaAgent(KDD 2025,多智能体因子挖掘)、alpha-gfn(结合强化学习的因子搜索)、以及华泰的「GPT 因子工厂」多智能体方案。本节讲清 LLM 因子挖掘的范式、典型工具与项目、闭环工具链的组成,以及这条前沿路线的机遇与挑战(幻觉、成本、可控性)。读完本节,你了解因子挖掘的最前沿方向,能评估各类工具的适用场景。
内容来源:仓库资料/因子挖掘.md,及公开的 RD-Agent、AlphaAgent(KDD 2025)、alpha-gfn、华泰 GPT 因子工厂等项目信息,知识结构化整理。
⚠️ 学习提示:LLM 因子挖掘是 2024-2025 年的最前沿,工具链仍在快速演进,远未成熟。LLM 会「幻觉」生成看似合理但错误的因子定义或代码,自动化闭环可能放大这种错误。务必对 LLM 产出的每个因子与代码做人工审计,别把「自动」等同于「可信」。
阅读完本节,你应当能够:
前面三节的因子挖掘方法都有局限:
LLM(大语言模型)的独特之处在于它具备语义理解 + 代码生成的双重能力:
这意味着 LLM 可以做前两种方法做不到的事:从海量文献里「读」出因子思路,而非只在数值空间里「搜」。它结合了人类研究员的语义洞察与机器的自动化效率。华泰「GPT 因子工厂」正是基于这个动机,用多智能体 LLM 协作挖因子。
一个完整的 LLM 因子挖掘闭环,通常包含这些环节:
关键环节:
这个闭环类似一个「自动化的研究员」——它模拟人类研究员的工作流(读文献、想因子、写代码、跑回测、分析、迭代),但速度与吞吐量远高于人类。
RD-Agent 是微软推出的「研究与开发智能体」框架,目标是自动化数据科学与研究领域的研究开发流程。在金融因子挖掘场景,RD-Agent 能:
RD-Agent 的特点是通用框架 + 领域适配——它不是专为金融设计,但通过配置与提示,能高效用于因子挖掘。它的开源生态使其成为研究者构建自定义 LLM 因子挖掘系统的起点。
AlphaAgent 是发表在 KDD 2025 的多智能体因子挖掘系统,代表学术前沿。它用多个专业化 LLM 智能体协作:
多智能体设计的优势是分工专业化——每个智能体专注一个环节,类似人类研究团队的角色分工。AlphaAgent 展示了 LLM 在因子挖掘上达到甚至超越人类研究员水平的潜力(在特定数据集上)。
alpha-gfn 结合强化学习与 LLM 进行因子搜索。它把因子挖掘建模为一个序贯决策问题:LLM 每次提议一个因子变体,回测绩效作为奖励信号,强化学习算法引导 LLM 朝高绩效方向搜索。这种「LLM + RL」的组合,兼具 LLM 的语义创造力与 RL 的目标导向优化能力,是另一条有前景的路线。
华泰金工提出的「GPT 因子工厂」是国内卖方对 LLM 因子挖掘的探索,采用多智能体架构:
这是卖方研究从「人工挖因子」向「人机协作挖因子」转型的标志。
完整的 LLM 因子挖掘工具链包含几层:
| 层 | 工具/组件 | 作用 |
|---|---|---|
| LLM 基座 | GPT-4/Claude/开源大模型 | 语义理解与代码生成 |
| 智能体框架 | LangChain/AutoGen/CrewAI | 编排多智能体协作 |
| 专业框架 | RD-Agent/AlphaAgent | 因子挖掘专用流程 |
| 数据层 | qlib/Tushare/Wind | 行情与基本面数据 |
| 回测层 | qlib/backtrader/自研 | 因子测试与组合回测 |
| 因子库 | 自研数据库 | 积累与版本管理因子 |
| 编排与监控 | MLflow/Weights & Biases | 实验跟踪与结果管理 |
开源生态里,基于 qlib(微软的 AI 量化平台)构建 LLM 因子挖掘系统是常见路径——qlib 提供数据、回测、模型评估的基础设施,LLM 智能体在其上负责因子提议与代码生成。
💡 工具链心法:LLM 因子挖掘的难点不在 LLM 本身,而在把 LLM 与可靠的数据/回测基础设施整合。LLM 产出的因子代码必须能在真实的 qlib/自研框架上正确运行与回测,这个集成工程是关键。直接让 LLM「自由发挥」往往产出无法运行的代码或错误的因子。
金融研报与论文里有海量因子思路,人类研究员只能读一小部分。LLM 能规模化阅读、提取、测试这些思路,极大拓展因子来源。
LLM 闭环模拟人类研究员工作流,能 7×24 小时持续产出与迭代因子,吞吐量远超人类。
LLM 不是替代人类,而是「研究员的副驾驶」——人类提供方向与判断,LLM 提供执行力与广度。这种协作可能重塑研究流程。
LLM 训练数据广,能把其他领域(如机器学习、信号处理、心理学)的方法迁移到因子挖掘,产生跨学科创新。
LLM 会「一本正经地胡说八道」——生成看似合理但错误的因子定义或代码。例如,它可能编造一个不存在的指标,或写出逻辑错误的代码。这是 LLM 因子挖掘的头号风险。
对策:每个 LLM 产出的因子与代码必须人工审计;代码要在真实数据上验证;因子定义要回溯到原始文献核对。
调用强大 LLM(如 GPT-4)成本高,大规模因子挖掘(成百上千次提议-回测迭代)费用可观。速度也受限于 LLM 推理延迟。
LLM 的输出有随机性,同样的输入可能产出不同因子,难以严格控制。自动化闭环可能放大错误——一个错误的因子被采纳后,可能污染因子库。
LLM 挖出的因子同样面临过拟合(甚至更严重,因为它能快速尝试海量组合)。且 LLM 可能「记住」训练数据里的已知因子,产出的是已知因子的变体,而非真正的新发现。
通用 LLM 对金融的深度理解有限,可能提出表面合理但实质错误的因子(如忽略 A 股的交易规则、数据可得性)。需要领域专家持续校准。
⚠️ 学习提示:LLM 因子挖掘的「自动化」极易让人放松警惕,但它的每个产出都需要人类专家的审计。在金融这种对稳健性与可解释性要求高的领域,「LLM 提议 + 人类审核 + 严格回测」的半自动模式,比「完全自动」更现实可信。
把 LLM 因子挖掘放回本章的范式谱系:
人工因子 → 遗传规划 → 神经网络 → LLM 因子挖掘 经济逻辑 数值搜索 数值学习 语义+代码
每种范式捕捉不同维度:
它们互补而非替代。成熟的因子挖掘体系常结合多种:LLM 从文献提思路,遗传规划搜数值变体,神经网络学复杂组合,人工审核与经济逻辑把关。这种「多范式协作」可能是未来的主流。
本章讲完了因子挖掘的四种范式,也接近全教程 AI 选股部分的尾声。回顾从第 4 章到本章的脉络:
这条脉络体现了量化研究「方法论不断进化、自动化程度不断提升」的趋势。但无论方法多先进,几个原则不变:经济逻辑优先、过拟合警惕、样本外验证、成本控制、多因子互补。这些是第 1 章强调的批判眼光,贯穿全教程。
⚠️ 学习提示:LLM 因子挖掘是最前沿也最「炫」的方向,但别被「自动」「智能」冲昏头脑。金融的本质没变——低信噪比、非平稳、过拟合风险。LLM 是强大的工具,但它不能替代严谨的研究方法与批判思维。用 LLM 放大你的能力,而非替代你的判断。
本章结束,全教程的 AI 选股与因子挖掘部分也告一段落。下一章(第 9 章)我们转向投资组合优化与风控——挖出的因子如何转化为可落地的投资组合,这是量化研究「最后一公里」的关键。