第 8 章 · 03 神经网络因子挖掘 本节摘要:本节讲因子挖掘的第二条线——神经网络因子挖掘。第 01 节的遗传规划用「符号运算」搜显式公式,可解释但难表达超高维非线性;本节的神经网络方法(以第 5 章 AlphaNet 为思想延伸)让网络自动学习特征组合,用端到端训练替代人工特征工程,理论上能挖出更复杂的因子。核心思想是表示学习(representation learning)——网络把原始量价数据层层抽象成高层特征表示,这些表示本身就是「因子」。本节对比神经网络因子挖掘与人工因子、遗传规划因子的差异,讲清表示学习的原理、AlphaNet 式因子挖掘网络的设计、以及相对人工因子的优势(自动、可学复杂组合)与局限(黑盒、过拟合、计算重)。
本节摘要:本节讲因子挖掘的第二条线——神经网络因子挖掘。第 01 节的遗传规划用「符号运算」搜显式公式,可解释但难表达超高维非线性;本节的神经网络方法(以第 5 章 AlphaNet 为思想延伸)让网络自动学习特征组合,用端到端训练替代人工特征工程,理论上能挖出更复杂的因子。核心思想是表示学习(representation learning)——网络把原始量价数据层层抽象成高层特征表示,这些表示本身就是「因子」。本节对比神经网络因子挖掘与人工因子、遗传规划因子的差异,讲清表示学习的原理、AlphaNet 式因子挖掘网络的设计、以及相对人工因子的优势(自动、可学复杂组合)与局限(黑盒、过拟合、计算重)。读完本节,你理解「让网络挖因子」这条路线的价值与边界,为下一节 LLM 因子挖掘打底。
内容来源:仓库研报 华泰 AI 系列第 32/34 篇(AlphaNet)的思想延伸,知识结构化整理。
⚠️ 学习提示:神经网络因子挖掘的「自动」是双刃剑——它省去人工特征工程,但也让因子变成黑盒,难以审计与诊断。在金融这种需要可解释性与稳健性的领域,黑盒因子的实盘可信度需谨慎评估。
阅读完本节,你应当能够:
前面章节涉及三种因子挖掘范式,先对比定位:
| 范式 | 代表 | 因子形态 | 可解释性 | 复杂度 | 过拟合风险 |
|---|---|---|---|---|---|
| 人工因子 | 传统研究员 | 显式公式(人想) | 高 | 低 | 低(有经济逻辑) |
| 遗传规划因子 | 华泰 AI 21/23 | 显式公式(机器搜) | 中(公式可读但可能复杂) | 中 | 高(搜索空间大) |
| 神经网络因子 | AlphaNet(华泰 AI 32/34) | 隐式表示(网络权重) | 低(黑盒) | 高 | 高(参数多) |
人工因子有强经济逻辑但受想象力限制;遗传规划自动搜显式公式,平衡自动化与可解释;神经网络让网络自动学特征组合,能表达最复杂的非线性,但牺牲可解释性。本节聚焦神经网络因子挖掘这条线。
传统机器学习里,特征(因子)是人工设计的,模型只学「如何组合特征」。表示学习(representation learning)把这个分工打破——让模型不仅学组合,还学特征本身。
神经网络天然适合表示学习:它的每一层都在对输入做变换,浅层学简单特征(如短期收益率),深层学复杂组合(如「某条件下的量价背离」)。这些中间层的输出,就是网络自动学到的「因子」。
在金融里,这意味着:
与人工因子的区别:人工因子是研究员「先想公式,再算值」;神经网络因子是「给数据,让网络学出值」。后者跳过了「想公式」这一步,直接从数据到因子。
第 5 章详讲的 AlphaNet(华泰 AI 32/34)是神经网络因子挖掘的典型代表。回顾其结构:
AlphaNet 的精髓在于**「人机结合」**——它没有完全抛弃人工先验(特征提取层的函数是人工设计的),而是把这些先验作为网络的第一层,让网络在数据驱动下学这些先验组合的权重。这样既享受了表示学习的自动性,又保留了部分可解释性。
AlphaNet 式因子挖掘网络的几种变体:
💡 设计心法:在金融这种低信噪比领域,完全黑盒的端到端网络往往不如「半端到端」——后者把人工先验注入网络,等于给网络「提示」,降低过拟合风险。AlphaNet 的成功部分源于此。
神经网络因子挖掘相对传统人工因子,有几个优势:
传统因子库里每个因子都需人工构造、测试、筛选,耗时耗力。神经网络自动学特征组合,大幅降低人工成本,尤其适合「因子需求大、迭代快」的场景。
人工因子多是单变量或简单组合(如 PE × ROE)。神经网络能学高阶、条件化的非线性组合(如「在低波动条件下,某量价背离才有效」),这类组合人工难以穷举。
传统流程是「先挖因子,再选模型」两阶段,因子与模型割裂。神经网络把「特征构造」与「预测建模」联合优化,效率更高。
神经网络可能学到人想不到甚至反直觉的特征组合,这些组合若统计上稳健,可能是有价值的发现。
神经网络因子是隐式表示,不像遗传规划产出显式公式。难以回答「这个因子到底在捕捉什么经济信号」,这在需要向投资委员会解释策略时是障碍。
神经网络参数众多,金融信噪比低,极易过拟合。必须配合严格的时序交叉验证、样本外检验、Dropout/正则化等手段。
训练神经网络因子挖掘模型,比计算人工因子或遗传规划更耗算力。迭代与调参成本不低。
神经网络对数据质量敏感,缺失、异常、未来函数都会显著影响。需要严格的数据清洗与对齐。
神经网络因子可能对训练期敏感——换段历史,因子表现可能大幅变化。这与人工因子(有经济逻辑支撑,失效后可能回归)形成对比。
⚠️ 学习提示:神经网络因子的「高 IC」在训练集上几乎一定能达到,关键是样本外与不同行情的稳健性。学本节时,警惕「训练集 IC 高」的诱惑,把样本外与时序交叉作为采纳的底线。
神经网络因子挖掘与遗传规划各有优劣,实战中常互补:
| 维度 | 遗传规划 | 神经网络 |
|---|---|---|
| 因子形态 | 显式公式 | 隐式表示 |
| 可解释性 | 中(公式可读) | 低(黑盒) |
| 复杂度 | 中 | 高 |
| 搜索空间 | 算子×变量组合 | 网络权重空间 |
| 适合场景 | 需可解释、中等复杂因子 | 需复杂非线性、自动特征工程 |
实战常这样结合:
神经网络因子挖掘是因子生产方式进化的重要一环:
人工因子(传统) → 遗传规划因子(华泰 AI 21/23) → 神经网络因子(AlphaNet 32/34) → LLM 因子(下节) 经济逻辑强 自动+可解释 自动+复杂非线性 自动+语义理解 想象力受限 过拟合风险高 黑盒+过拟合 前沿,工具链待成熟
每种范式都有其价值与边界,没有绝对的「最优」。成熟的因子库常混合多种范式:人工因子提供经济逻辑基础,遗传规划与神经网络提供自动化扩展,LLM(下节)提供语义维度的新视角。
💡 定位心法:不要把神经网络因子挖掘当作「替代人工因子」的银弹,而应看作因子库的「增强层」。它的价值在「自动学复杂组合、与人工因子互补」,而非「淘汰人工」。这种多元共存的视角,是因子工程成熟的标志。
下一节,我们看因子挖掘的最新前沿——LLM 因子挖掘与工具链,用大语言模型生成因子、写代码、跑回测,形成闭环,并盘点 RD-Agent、AlphaAgent 等新工具。