第 7 章 · 04 量价选股体系概览 本节摘要:本节是本章的收束,基于华泰 AI 系列第 28 篇「基于量价的人工智能选股体系概览」,把前三节讲的零散量价与高频因子体系化组织,展示全景。量价因子是 AI 选股的主战场——华泰 AI 系列从第 8 篇(MLP)到 AlphaNet(32/34),输入大多以量价为主。本节讲清:量价因子如何体系化组织(按数据颗粒度与经济逻辑分族)、量价因子与基本面因子的互补关系、以及为 AI 选股做特征工程时的关键要点(去极值、标准化、行业中性化、缺失值处理、特征衍生)。读完本节,你建立量价选股的整体框架,知道如何把零散因子组织成体系,并为第 8 章的因子挖掘与第 5 章的深度学习选股打好特征工程基础。
本节摘要:本节是本章的收束,基于华泰 AI 系列第 28 篇「基于量价的人工智能选股体系概览」,把前三节讲的零散量价与高频因子体系化组织,展示全景。量价因子是 AI 选股的主战场——华泰 AI 系列从第 8 篇(MLP)到 AlphaNet(32/34),输入大多以量价为主。本节讲清:量价因子如何体系化组织(按数据颗粒度与经济逻辑分族)、量价因子与基本面因子的互补关系、以及为 AI 选股做特征工程时的关键要点(去极值、标准化、行业中性化、缺失值处理、特征衍生)。读完本节,你建立量价选股的整体框架,知道如何把零散因子组织成体系,并为第 8 章的因子挖掘与第 5 章的深度学习选股打好特征工程基础。
内容来源:仓库研报 华泰 AI 系列第 28 篇(基于量价的人工智能选股体系概览),知识结构化整理。
⚠️ 学习提示:量价因子体系庞大,容易陷入「因子越多越好」的误区。体系化的关键不是堆数量,而是低相关、逻辑清晰、互补。一个组织良好的小因子库,常优于一个杂乱的大因子库。
阅读完本节,你应当能够:
前面三节讲了大量量价/高频因子:大单主买、主买占比、委托失衡、已实现波动、跳跃波动、收益分布、日内偏度峰度……加上传统量价(动量、反转、波动率、换手率、量价相关),量价因子动辄上百个。但简单堆砌因子有几个问题:
华泰 AI 28 的核心贡献就是把这些零散因子体系化组织——按数据颗粒度与经济逻辑分族,族内细分,族间互补,形成清晰的因子库结构。这既便于管理(增删因子、监控失效),也利于下游 AI 模型高效利用。
华泰 AI 28 给出的量价因子体系,大致按两个维度组织:
| 颗粒度 | 因子族 | 代表因子 |
|---|---|---|
| 日频量价 | 传统量价族 | 动量、反转、日线波动率、换手率、量价相关 |
| 分钟级 | 日内分布族 | 已实现波动、日内偏度/峰度、尾盘活跃度 |
| Level2/逐笔 | 微观结构族 | 大单净流入、主买占比、委托失衡、跳跃波动 |
颗粒度越细,信息密度越高,但衰减越快、成本越高。
| 逻辑族 | 刻画什么 | 代表因子 |
|---|---|---|
| 趋势类 | 价格变动方向 | 动量、反转、日内动量 |
| 波动类 | 价格波动幅度 | 日线波动率、已实现波动、连续/跳跃波动 |
| 资金流类 | 主力买卖行为 | 大单净流入、主买占比 |
| 微观结构类 | 盘口与订单流 | 委托失衡、买卖价差 |
| 量价关联类 | 价与量的联动 | 量价相关、量价背离 |
两个维度交叉,形成一个「颗粒度 × 逻辑」的因子矩阵。每个因子都可定位到这个矩阵的某格,体系结构清晰。
量价因子与基本面因子(估值、成长、质量、一致预期)是两类互补的信号源:
| 维度 | 基本面因子 | 量价因子 |
|---|---|---|
| 数据来源 | 财务、预期 | 行情、Level2 |
| 更新频率 | 季度/月度(财报) | 日/分钟/逐笔 |
| 信号性质 | 长期价值、质量 | 短期行为、情绪、微观 |
| 衰减速度 | 慢(半衰期数月) | 快(半衰期数天) |
| 容量 | 大(低换手) | 小(高换手,偏小盘) |
| 相关性 | 与量价因子低相关 | — |
互补性体现在:
华泰 AI 28 强调,AI 选股的输入常同时含基本面与量价因子,让模型学习两者的非线性组合,效果优于单类因子。
把因子喂给 AI 模型(MLP/RNN/CNN/AlphaNet)前,必须做特征工程,把原始因子转化为模型友好的输入。这是 AI 选股成败的关键,常被忽视。华泰系列(尤其 AI 28)强调以下步骤:
金融因子常有极端值(如某股 PE 上万),会扭曲模型。常用** MAD 法**(中位数绝对偏差):把超过中位数 ±N×MAD 的值截断。比 3σ 更稳健,不受极端值影响。
不同因子量纲不同(PE 是倍数,换手率是百分比),需标准化到同一尺度。常用 Z-score:(值 - 均值)/ 标准差。标准化要截面进行——每个调仓日,对该日所有股票的每个因子单独标准化,消除时间维度的水平漂移。
很多因子与行业、市值强相关(如银行股 PE 低,小盘股波动率高)。若不剔除,模型可能只学到「行业/市值效应」而非因子本身的预测力。常用回归取残差:用因子值对行业哑变量与市值的对数做回归,取残差作为中性化后的因子值。
金融数据常有缺失(停牌、退市、财报未发)。处理方式:
在原始因子基础上衍生新特征,提升模型表达力。常见衍生:
💡 核心心法:特征工程不是「锦上添花」,而是 AI 选股的「地基」。一个组织良好、清洗干净的因子库,即使配简单模型(如逻辑回归),也能跑出不错的效果;反之,因子库混乱,再深的模型也无济于事。华泰系列反复强调「数据与特征工程 > 模型复杂度」,在金融这种低信噪比领域尤其如此。
华泰 AI 28 作为「量价 AI 选股体系」的概览性研报,几个核心要点:
把上述要素串起来,一个典型的量价 AI 选股流程:
这个流程连接了第 2 章(因子)、第 5 章(深度学习模型)、第 7 章(量价因子)、第 9 章(组合优化),是 AI 选股的完整骨架。
⚠️ 学习提示:量价选股体系是华泰 AI 系列的核心战场,它的价值在「体系化组织 + 特征工程 + AI 模型」三位一体。学本节时,重点把握「如何把零散因子组织成体系」与「特征工程的关键步骤」,这两个方法论比任何具体因子都更重要——它们决定了你能否把任何新数据(另类数据、新高频数据)快速融入选股框架。
本章结束。下一章我们进入第 8 章 因子挖掘新范式——从「人手工想因子」进化到「机器自动挖因子」,先看遗传规划自动因子挖掘。