第 6 章 · 04 综述与论文清单:AI 量化的全景图 本节摘要:本节用 quant-wiki docs/ai 下的综述与论文清单,梳理 AI 量化的全景图。核心素材包括:2025 AI 量化论文 41 篇(docs/ai/2025-ai-paper),覆盖 AI/LLM、股票、外汇、商品、固收、信用、组合优化、LOB、衍生品、加密等主题;2024 AI / LLM 量化论文(docs/ai/2024-ai-paper、2024-llm-quant-paper);GPT 影响量化金融(docs/ai/HowOpenAIsGPTwillaffectQuantitativeFinance);chat-paper 速读(docs/ai/chat-paper),介绍用 LLM
本节摘要:本节用 quant-wiki docs/ai 下的综述与论文清单,梳理 AI 量化的全景图。核心素材包括:2025 AI 量化论文 41 篇(docs/ai/2025-ai-paper),覆盖 AI/LLM、股票、外汇、商品、固收、信用、组合优化、LOB、衍生品、加密等主题;2024 AI / LLM 量化论文(docs/ai/2024-ai-paper、2024-llm-quant-paper);GPT 影响量化金融(docs/ai/How_OpenAI_s_GPT_will_affect_Quantitative_Finance);chat-paper 速读(docs/ai/chat-paper),介绍用 LLM 自动生成学术论文(Novy-Marx & Velikov 的 Assaying Anomalies);以及 Transformer、Diffusion Models、VQVAE(docs/ai/llm)三类深度学习模型在金融里的应用。本节是「地图」——给你一张文献入口和学习路径,具体细节回到原始论文。素材来自 docs/ai。
内容来源:quant-wiki docs/ai(2025-ai-paper、2024-ai-paper、2024-llm-quant-paper、How_OpenAI_s_GPT_will_affect_Quantitative_Finance、chat-paper、llm/Transformer、llm/Diffusion Models、llm/VQVAE),知识结构化整理。
⚠️ 学习提示:论文清单是「地图」不是「食谱」。一篇论文读不懂很正常,先抓摘要与结论,理解它解决什么问题、用什么方法、得到什么结论,细节留待需要时深挖。优先读综述类,再按兴趣钻专题。
阅读完本节,你应当能够:
docs/ai/2025-ai-paper 收录的 41 篇论文,可按主题分成几大类,这恰好构成 AI 量化的全景:
| 主题 | 代表论文 |
|---|---|
| AI/LLM | CausalStock(因果发现预测股价)、FinRobot(投研智能体)、FinLlama(LLM 情感)、InvestESG(多智能体 RL) |
| 股票 | 因子动量 vs 价格动量、机构交易推断、文化保密与股价同步性 |
| 外汇 | 汇率波动事件、2024 美国大选后的机构交互 |
| 商品 | 电力价格长期季节性外推 |
| 固收 | 多期限结构 HJM 框架 |
| 信用 | ABS 定价、信息跨度与信用市场竞争 |
| 组合优化 | M6 预测竞赛、聚类分层组合构造、可解释 ML 预测激进投资 |
| LOB/微观结构 | 高效交易与价格冲击、无遗憾做市、跨资产流动性脆弱性 |
| 衍生品 | 粗糙波动率的深度学习可解释性 |
💡 阅读策略:先从你最关心的资产类别或方法切入(比如做股票的先读「股票市场」类,做高频的先读「LOB」类),再横向扩展。每篇先读摘要与结论,30 分钟判断是否值得深读。
docs/ai/llm 下有三个模型介绍:Transformer、Diffusion Models、VQVAE。它们本是计算机视觉/NLP 的通用模型,近年被引入金融。
Transformer 的自注意力机制擅长捕捉长程依赖,在金融里主要用于:
代表论文 Modality-aware Transformer 把价格与文本模态显式分离建模,提升预测精度。但 Transformer 的缺点是数据饥渴(需大量样本)与可解释性弱。
扩散模型通过「加噪—去噪」过程学习数据分布,在金融里主要用于:
扩散模型在金融的价值在于「数据稀缺」场景——金融危机样本少,合成数据能扩充训练集。但要警惕合成数据可能放大原有偏见。
VQVAE(Vector Quantized Variational Autoencoder)把连续数据压缩成离散码本(codebook),在金融里可用于:
VQVAE 的离散化特性天然适合「市场状态识别」,与第 7 章的市场状态切换组合策略呼应。
docs/ai/chat-paper 介绍了 Novy-Marx & Velikov(2024)的「AI Powered Scholarship」——用 LLM 自动化金融学术研究。流程分三步:
chat-paper 特别强调这种自动化的双刃剑:
⚠️ 陷阱:多重检验(multiple testing)是这种自动化的核心威胁——测了 17,074 个信号,即便纯随机也会有大量「显著」结果。必须用 FDR(False Discovery Rate)校正、Bonferroni 调整等统计方法控制虚假发现率。Novy-Marx 的方法本身就是为应对这一问题而设计的「逐层过滤」。
chat-paper 的流程对量化因子挖掘有直接启示:
docs/ai/How_OpenAI_s_GPT_will_affect_Quantitative_Finance 探讨了 GPT 对量化行业的系统性影响。核心观点可归纳为:
GPT 能大幅加速文献综述、代码编写、数据清洗、报告撰写等「非核心但耗时」的环节。研究员能把更多精力放在「找新数据源、设计新因子、做假设检验」等创造性工作上。
GPT 让非深度技术背景的人也能快速写出可运行的回测代码(参考 ChatGPT-quant 的六步流程),降低了量化研究的入门门槛。但这同时也意味着「同质化策略」更多,套利机会消失更快。
传统因子挖掘靠人力(研究员提假设、写公式、回测),GPT 能从论文、财报、新闻里自动提炼因子候选,把因子库从「几百个手工因子」扩展到「成千上万个候选」。但这也带来多重检验与过拟合风险(见 chat-paper 的 HARKing)。
基于 docs/ai 的文献地图,推荐一条循序渐进的学习路径:
💡 心法:AI 量化是快速演进的领域,「学会学习」比「记住当前方法」更重要。建立自己的论文追踪清单(每周/每月扫一遍 arXiv 与 docs/ai 更新),形成持续学习的习惯。
下一章,我们回到组合层面:CAPM、Fama-French、多因子模型、Barra、HRP 与风险平价,把信号组织成投资组合。