第 7 章 · 04 量价选股体系概览


文档摘要

第 7 章 · 04 量价选股体系概览 本节摘要:本节是本章的收束,基于华泰 AI 系列第 28 篇「基于量价的人工智能选股体系概览」,把前三节讲的零散量价与高频因子体系化组织,展示全景。量价因子是 AI 选股的主战场——华泰 AI 系列从第 8 篇(MLP)到 AlphaNet(32/34),输入大多以量价为主。本节讲清:量价因子如何体系化组织(按数据颗粒度与经济逻辑分族)、量价因子与基本面因子的互补关系、以及为 AI 选股做特征工程时的关键要点(去极值、标准化、行业中性化、缺失值处理、特征衍生)。读完本节,你建立量价选股的整体框架,知道如何把零散因子组织成体系,并为第 8 章的因子挖掘与第 5 章的深度学习选股打好特征工程基础。

第 7 章 · 04 量价选股体系概览

本节摘要:本节是本章的收束,基于华泰 AI 系列第 28 篇「基于量价的人工智能选股体系概览」,把前三节讲的零散量价与高频因子体系化组织,展示全景。量价因子是 AI 选股的主战场——华泰 AI 系列从第 8 篇(MLP)到 AlphaNet(32/34),输入大多以量价为主。本节讲清:量价因子如何体系化组织(按数据颗粒度与经济逻辑分族)、量价因子与基本面因子的互补关系、以及为 AI 选股做特征工程时的关键要点(去极值、标准化、行业中性化、缺失值处理、特征衍生)。读完本节,你建立量价选股的整体框架,知道如何把零散因子组织成体系,并为第 8 章的因子挖掘与第 5 章的深度学习选股打好特征工程基础。

内容来源:仓库研报 华泰 AI 系列第 28 篇(基于量价的人工智能选股体系概览),知识结构化整理。

⚠️ 学习提示:量价因子体系庞大,容易陷入「因子越多越好」的误区。体系化的关键不是堆数量,而是低相关、逻辑清晰、互补。一个组织良好的小因子库,常优于一个杂乱的大因子库。

学习目标

阅读完本节,你应当能够:

  1. 说清量价因子的体系化组织方式(按颗粒度与逻辑分族)。
  2. 理解量价因子与基本面因子的互补关系。
  3. 掌握 AI 选股特征工程的关键步骤(去极值/标准化/中性化/缺失值/衍生)。
  4. 建立量价选股的整体框架,连接前 3 节与第 5 章。

一、为什么需要「体系化」:因子不是越多越好

前面三节讲了大量量价/高频因子:大单主买、主买占比、委托失衡、已实现波动、跳跃波动、收益分布、日内偏度峰度……加上传统量价(动量、反转、波动率、换手率、量价相关),量价因子动辄上百个。但简单堆砌因子有几个问题:

  • 高相关冗余:很多因子高度相关(如大单净流入与主买占比),冗余因子边际价值小,还放大噪声。
  • 逻辑混乱:没有清晰分类,难以诊断哪个族失效、哪个族贡献大。
  • 维度灾难:因子太多,机器学习模型易过拟合。

华泰 AI 28 的核心贡献就是把这些零散因子体系化组织——按数据颗粒度与经济逻辑分族,族内细分,族间互补,形成清晰的因子库结构。这既便于管理(增删因子、监控失效),也利于下游 AI 模型高效利用。

二、量价因子的体系化组织:按颗粒度与逻辑分族

华泰 AI 28 给出的量价因子体系,大致按两个维度组织:

维度 1:按数据颗粒度

颗粒度 因子族 代表因子
日频量价 传统量价族 动量、反转、日线波动率、换手率、量价相关
分钟级 日内分布族 已实现波动、日内偏度/峰度、尾盘活跃度
Level2/逐笔 微观结构族 大单净流入、主买占比、委托失衡、跳跃波动

颗粒度越细,信息密度越高,但衰减越快、成本越高。

维度 2:按经济逻辑

逻辑族 刻画什么 代表因子
趋势类 价格变动方向 动量、反转、日内动量
波动类 价格波动幅度 日线波动率、已实现波动、连续/跳跃波动
资金流类 主力买卖行为 大单净流入、主买占比
微观结构类 盘口与订单流 委托失衡、买卖价差
量价关联类 价与量的联动 量价相关、量价背离

两个维度交叉,形成一个「颗粒度 × 逻辑」的因子矩阵。每个因子都可定位到这个矩阵的某格,体系结构清晰。

三、量价因子与基本面因子的互补

量价因子与基本面因子(估值、成长、质量、一致预期)是两类互补的信号源:

维度 基本面因子 量价因子
数据来源 财务、预期 行情、Level2
更新频率 季度/月度(财报) 日/分钟/逐笔
信号性质 长期价值、质量 短期行为、情绪、微观
衰减速度 慢(半衰期数月) 快(半衰期数天)
容量 大(低换手) 小(高换手,偏小盘)
相关性 与量价因子低相关

互补性体现在:

  • 信息维度互补:基本面看「公司值不值」,量价看「市场怎么交易」。两者结合,既捕价值也捕行为。
  • 频率互补:基本面因子更新慢,适合月频调仓;量价因子更新快,适合日/周频。两者结合,适应不同调仓频率。
  • 容量互补:基本面因子容量大,适合大资金主策略;量价因子容量小,适合中小资金增强或大资金小幅超配。

华泰 AI 28 强调,AI 选股的输入常同时含基本面与量价因子,让模型学习两者的非线性组合,效果优于单类因子。

四、AI 选股的特征工程:从因子到模型输入

把因子喂给 AI 模型(MLP/RNN/CNN/AlphaNet)前,必须做特征工程,把原始因子转化为模型友好的输入。这是 AI 选股成败的关键,常被忽视。华泰系列(尤其 AI 28)强调以下步骤:

步骤 1:去极值

金融因子常有极端值(如某股 PE 上万),会扭曲模型。常用** MAD 法**(中位数绝对偏差):把超过中位数 ±N×MAD 的值截断。比 3σ 更稳健,不受极端值影响。

步骤 2:标准化

不同因子量纲不同(PE 是倍数,换手率是百分比),需标准化到同一尺度。常用 Z-score:(值 - 均值)/ 标准差。标准化要截面进行——每个调仓日,对该日所有股票的每个因子单独标准化,消除时间维度的水平漂移。

步骤 3:行业中性化(与市值中性化)

很多因子与行业、市值强相关(如银行股 PE 低,小盘股波动率高)。若不剔除,模型可能只学到「行业/市值效应」而非因子本身的预测力。常用回归取残差:用因子值对行业哑变量与市值的对数做回归,取残差作为中性化后的因子值。

步骤 4:缺失值处理

金融数据常有缺失(停牌、退市、财报未发)。处理方式:

  • 填零/填中位数:简单,但可能引入偏差。
  • 前向填充:用上一个有效值,适合短期缺失。
  • 模型自带处理:如 XGBoost 能处理缺失,神经网络则需先填充。

步骤 5:特征衍生

在原始因子基础上衍生新特征,提升模型表达力。常见衍生:

  • 历史分位数:因子值在过去 N 天的分位(多因子 13),捕捉相对历史水平。
  • 因子变化:因子值的差分或变化率(如一致预期的上修)。
  • 因子平滑:移动平均,降噪。
  • 因子交互:两个因子的乘积或比值(如 PE × ROE)。

💡 核心心法:特征工程不是「锦上添花」,而是 AI 选股的「地基」。一个组织良好、清洗干净的因子库,即使配简单模型(如逻辑回归),也能跑出不错的效果;反之,因子库混乱,再深的模型也无济于事。华泰系列反复强调「数据与特征工程 > 模型复杂度」,在金融这种低信噪比领域尤其如此。

五、华泰 AI 28 的体系概览要点

华泰 AI 28 作为「量价 AI 选股体系」的概览性研报,几个核心要点:

  1. 量价为主输入:AI 选股的输入以量价因子为主(信息密度高、与 AI 的非线性组合能力契合),基本面因子作为补充。
  2. 多颗粒度融合:日频、分钟、Level2 多颗粒度因子共同输入,让模型学习不同时间尺度的信号。
  3. 体系化组织:因子按颗粒度与逻辑分族,族间低相关互补,便于管理与迭代。
  4. 特征工程前置:严格的去极值、截面标准化、中性化、缺失值处理,是模型有效的前提。
  5. AI 模型选型:从 MLP 到 RNN/CNN/AlphaNet,根据输入结构与任务选模型(第 5 章详述)。
  6. 样本外与时序交叉验证:防过拟合的核心,见华泰 AI 14/16。

六、量价选股体系的实战流程

把上述要素串起来,一个典型的量价 AI 选股流程:

这个流程连接了第 2 章(因子)、第 5 章(深度学习模型)、第 7 章(量价因子)、第 9 章(组合优化),是 AI 选股的完整骨架。

七、量价选股的适用边界

  • AI 不是魔法:AI 模型在量价因子上的提升,主要来自「学非线性组合」,而非「凭空造信号」。输入因子若质量差,模型也救不了。
  • 过拟合风险高:量价因子噪声大,AI 模型参数多,极易过拟合。务必严格时序交叉验证、样本外检验。
  • 衰减与成本:量价 AI 选股换手高,扣成本后效果打折。需用保守成本假设评估。
  • 拥挤与失效:量价 AI 策略一旦被广泛使用,信号会被套利消失。需持续迭代因子库、监控拥挤度。

⚠️ 学习提示:量价选股体系是华泰 AI 系列的核心战场,它的价值在「体系化组织 + 特征工程 + AI 模型」三位一体。学本节时,重点把握「如何把零散因子组织成体系」与「特征工程的关键步骤」,这两个方法论比任何具体因子都更重要——它们决定了你能否把任何新数据(另类数据、新高频数据)快速融入选股框架。

本节要点回顾

  1. 体系化动机:简单堆砌因子会冗余、混乱、维度灾难;需按颗粒度与逻辑分族,族间低相关互补。
  2. 两维组织:颗粒度(日频/分钟/Level2)× 逻辑(趋势/波动/资金流/微观/量价关联),形成因子矩阵。
  3. 与基本面互补:数据源、频率、信号性质、衰减、容量全方位互补;AI 选股常同时输入两类,效果优于单类。
  4. 特征工程五步:去极值(MAD)、截面标准化(Z-score)、行业/市值中性化(回归残差)、缺失值处理、特征衍生(分位/变化/平滑/交互)。
  5. 核心心法:数据与特征工程 > 模型复杂度;干净因子库 + 简单模型 > 混乱因子库 + 深模型。
  6. 华泰 AI 28 要点:量价为主、多颗粒度融合、体系化、特征工程前置、模型选型、时序交叉验证。
  7. 完整流程:多源数据→因子构造→特征工程→AI 模型→预测→组合构建→回测验证→反馈优化。
  8. 适用边界:AI 非魔法(依赖因子质量)、过拟合风险高、衰减与成本、拥挤与失效——需持续迭代。

本章结束。下一章我们进入第 8 章 因子挖掘新范式——从「人手工想因子」进化到「机器自动挖因子」,先看遗传规划自动因子挖掘


发布者: 作者: 灏天文库 转发
评论区 (0)
U