第 5 章 · 03 卷积神经网络


文档摘要

第 5 章 · 03 卷积神经网络 本节摘要:本节讲卷积神经网络(Convolutional Neural Network,CNN)。前两节里,MLP 不处理时序,RNN/LSTM 串行处理时序但难抓局部形态。CNN 用卷积核(convolutional kernel)在序列上滑动,自动识别局部模式(如连续放量、长上影线、急涨急跌),再用池化层(pooling)压缩冗余,极大提升计算效率与模式抽取能力。核心概念包括卷积、感受野(receptive field)、特征图(feature map)。华泰 AI 系列第 15 篇把 CNN 引入选股,把量价数据当作「一维图像」处理,实证 CNN 能高效挖掘量价的局部形态信号,且训练速度远快于 RNN。

第 5 章 · 03 卷积神经网络

本节摘要:本节讲卷积神经网络(Convolutional Neural Network,CNN)。前两节里,MLP 不处理时序,RNN/LSTM 串行处理时序但难抓局部形态。CNN 用卷积核(convolutional kernel)在序列上滑动,自动识别局部模式(如连续放量、长上影线、急涨急跌),再用池化层(pooling)压缩冗余,极大提升计算效率与模式抽取能力。核心概念包括卷积、感受野(receptive field)、特征图(feature map)。华泰 AI 系列第 15 篇把 CNN 引入选股,把量价数据当作「一维图像」处理,实证 CNN 能高效挖掘量价的局部形态信号,且训练速度远快于 RNN。本节讲清 CNN 的卷积、池化、感受野等机制,以及它在量价局部模式挖掘上的应用与陷阱。

内容来源:仓库研报 华泰 AI 系列第 15 篇(卷积神经网络),知识结构化整理。

⚠️ 学习提示:CNN 善抓「形态」,但金融里的「形态」远不如图像里的猫狗稳定。过度依赖某种历史形态可能过拟合,务必做多样本外检验。

学习目标

阅读完本节,你应当能够:

  1. 说清卷积运算的过程与卷积核的作用。
  2. 解释池化层(max/average pooling)的功能。
  3. 理解感受野与多层堆叠的关系。
  4. 描述特征图的含义与维度变化。
  5. 理解 CNN 如何用于量价局部模式挖掘及其相对 RNN 的优势。

一、为什么需要 CNN:从图像识别到量价形态

CNN 最早在图像识别大放异彩——它能自动识别图像里的局部特征(边缘、纹理、形状),无需人工设计特征。这个能力同样适用于金融:一段量价序列里,「连续 3 天放量上涨」「长上影线伴随缩量」「急跌后地量横盘」这些都是局部形态,和图像里的「局部纹理」本质相似。

RNN 虽能处理时序,但它是「整体建模」——逐时间步累积,难以聚焦于某个短窗口内的形态。CNN 则用卷积核在序列上滑动,每次只看一个短窗口(如 5 天),专门抽取局部模式,再用多层堆叠把局部模式组合成全局模式。这种「先局部后全局」的层次化特征抽取,正是 CNN 的核心优势。

华泰 AI 系列第 15 篇正是基于这个动机,把 CNN 引入选股。它把量价序列看作「一维图像」,用一维卷积(1D Convolution)挖掘局部模式,实证在量价特征输入下,CNN 的预测 IC 与训练效率都不输 RNN,甚至在某些场景更优。

二、卷积运算:卷积核如何扫描序列

卷积运算的核心是卷积核(kernel,也叫 filter),它是一个小的权重矩阵(一维卷积里是一个小权重向量)。卷积核在输入序列上滑动,每滑动到一个位置,就与对应窗口的输入做点积,得到一个输出值。所有位置的输出拼起来,构成特征图(feature map)。

以一维卷积为例:输入序列长度为 T(如 30 天),卷积核大小为 K(如 5 天),步长(stride)为 1。卷积核从序列起点开始,每次覆盖 5 个时间步,做点积得到一个数,然后向右滑一格,再做一个点积,直到滑到序列末尾。最终输出长度为 T-K+1(如 26)的特征图。

输入序列: [x1, x2, x3, x4, x5, x6, ..., x30] 卷积核 K=5: [w1, w2, w3, w4, w5] 第 1 个位置: out1 = w1*x1 + w2*x2 + w3*x3 + w4*x4 + w5*x5 第 2 个位置: out2 = w1*x2 + w2*x3 + w3*x4 + w4*x5 + w5*x6 ...

关键性质:

  • 权重共享:同一个卷积核在所有位置用相同权重——这意味着它学的是「某种局部模式」,然后在整条序列上「搜寻」这种模式出现的所有位置。这极大减少参数量,也让模式识别具有平移不变性(模式出现在序列开头还是末尾都能被识别)。
  • 多通道输出:用多个卷积核(如 64 个),每个学不同的模式,输出多张特征图,堆叠起来就是「通道」维度。

三、池化层:压缩冗余,提取主要特征

卷积之后通常会接池化层(pooling),对特征图做下采样。两种常见池化:

  • 最大池化(Max Pooling):在窗口内取最大值。直觉是「这个局部模式有没有出现」——只要窗口内某个位置响应强烈,就保留这个强烈响应。
  • 平均池化(Average Pooling):在窗口内取平均值。更平滑,但会稀释强烈响应。

池化的作用:

  1. 降维:减小特征图长度,降低后续计算量。
  2. 平移鲁棒性:模式位置小幅偏移不影响池化输出,增强模型鲁棒性。
  3. 扩大感受野:池化后,后续卷积核「看到」的原序列范围更大。

💡 直觉理解:如果卷积核像「侦探」在序列上找某种形态,那么池化就像「汇总报告」——它把侦探在每个小区域的发现压缩成「有/无」,让上层只关心「这个模式出现过没有」,而不纠结具体位置。

四、感受野:从局部到全局的层次化抽取

感受野(Receptive Field)指网络某一层的输出,依赖的原序列的范围。单层卷积核大小为 K 时,该层输出的每个值只依赖原序列的连续 K 个时间步——这是「局部感受野」。

但多层卷积堆叠后,感受野会逐层扩大:

  • 第 1 层卷积核 K=5:感受野 5。
  • 第 2 层卷积核 K=5:感受野 5+5-1=9(因为第 2 层每个输入已是第 1 层 5 个值的综合)。
  • 第 3 层卷积核 K=5:感受野 9+5-1=13。

这就是 CNN「先局部后全局」的层次化机制——浅层卷积核学简单的短周期形态(如 5 天内的放量),深层卷积核把这些短周期形态组合成长周期模式(如 13 天的趋势反转)。与 RNN 的「逐点累积」不同,CNN 是「窗口套窗口」地抽象。

五、特征图与维度变化

一次卷积操作后,输出特征图的形状取决于几个参数:

参数 含义 影响
输入长度 T 序列长度(如 30 天) 越长信息越多,计算越慢
卷积核大小 K 核覆盖的窗口(如 5) 越大感受野越大,参数越多
步长 stride 每次滑动几格(如 1) 越大输出越短,信息损失多
填充 padding 序列两端补零 控制输出长度,保留边界信息
卷积核数 N 输出通道数(如 64) 越大学的模式越多,参数越多

输出长度计算:(T - K + 2*padding) / stride + 1。一个典型量价 CNN 会用 2-3 层卷积+池化,逐层降维,最后把特征图展平接全连接层输出预测。

六、CNN 在选股中的应用

华泰 AI 15 的应用范式:

  1. 输入:每只股票过去 N 天(如 30 天)的多个量价特征(开高低收成交量),构成 (N, 特征数) 的「一维图像」。
  2. 网络结构:多个「卷积层 + 池化层」堆叠 → 展平 → 全连接 → 输出预测收益。
  3. 卷积核:用不同大小的核(如 K=3、5、7)捕捉不同周期的局部形态。
  4. 训练:与 RNN 类似,时序切分,截面标准化。

实证结论:

  • 训练快:卷积可高度并行,远快于 RNN 的串行计算。
  • 局部模式强:在短期形态(如连续放量、长上影)的捕捉上,比 RNN 更直接。
  • 预测 IC 与 RNN 接近或更优:尤其在量价特征为主的场景。

七、CNN 的局限与改进

CNN 虽强,但也有局限:

  • 感受野有限:单层卷积核只看短窗口,要捕捉长周期依赖需堆很多层或用大核,参数与计算成本上升。后来有膨胀卷积(dilated convolution)在不增加参数的情况下扩大感受野。
  • 不显式建模时序顺序:卷积核本质是在做局部模式匹配,对「时间的先后」不像 RNN 那样显式建模。
  • 形态稳定性存疑:金融形态比图像形态弱得多,「头肩顶」这种经典形态在统计上未必稳定,过度依赖可能过拟合。

这些局限在 AlphaNet(下一节)里得到部分解决——AlphaNet 把 CNN 的卷积思想与人工特征生成函数结合,既保留局部模式抽取的高效,又注入金融先验。

⚠️ 学习提示:CNN 在选股里的价值,在于它提供了一种与 RNN 互补的视角——RNN 看「序列演化」,CNN 看「局部形态」。实践中常把两者结合(如 CNN 提取局部特征,再喂给 LSTM 建模时序),华泰 AI 系列后续也探索了这种混合结构。

本节要点回顾

  1. 动机:CNN 用卷积核扫描序列,自动识别局部形态(如放量、长上影),与 RNN 的「序列演化」视角互补。
  2. 卷积运算:卷积核(权重向量)在序列上滑动做点积,得到特征图;权重共享带来平移不变性与参数高效。
  3. 池化层:最大/平均池化降维、增强平移鲁棒性、扩大感受野。
  4. 感受野:单层局部、多层逐层扩大,实现「先局部后全局」的层次化抽取。
  5. 特征图:输出形状由输入长度、核大小、步长、填充、核数共同决定;典型结构为卷积+池化堆叠后展平接全连接。
  6. 选股应用:把量价序列当「一维图像」,华泰 AI 15 证明 CNN 训练快、局部模式强、IC 不输 RNN。
  7. 局限:感受野有限(→膨胀卷积)、不显式建模时序、形态稳定性存疑(→过拟合风险)。

下一节,我们看本章的重头戏——AlphaNet。它是华泰自研的因子挖掘网络,把 CNN 的卷积思想与金融特征生成函数(return/std/correlation 等)结合,实现了「端到端从原始量价数据自动挖掘因子」的飞跃。


发布者: 作者: 灏天文库 转发
评论区 (0)
U