第 5 章 · 03 卷积神经网络 本节摘要:本节讲卷积神经网络(Convolutional Neural Network,CNN)。前两节里,MLP 不处理时序,RNN/LSTM 串行处理时序但难抓局部形态。CNN 用卷积核(convolutional kernel)在序列上滑动,自动识别局部模式(如连续放量、长上影线、急涨急跌),再用池化层(pooling)压缩冗余,极大提升计算效率与模式抽取能力。核心概念包括卷积、感受野(receptive field)、特征图(feature map)。华泰 AI 系列第 15 篇把 CNN 引入选股,把量价数据当作「一维图像」处理,实证 CNN 能高效挖掘量价的局部形态信号,且训练速度远快于 RNN。
本节摘要:本节讲卷积神经网络(Convolutional Neural Network,CNN)。前两节里,MLP 不处理时序,RNN/LSTM 串行处理时序但难抓局部形态。CNN 用卷积核(convolutional kernel)在序列上滑动,自动识别局部模式(如连续放量、长上影线、急涨急跌),再用池化层(pooling)压缩冗余,极大提升计算效率与模式抽取能力。核心概念包括卷积、感受野(receptive field)、特征图(feature map)。华泰 AI 系列第 15 篇把 CNN 引入选股,把量价数据当作「一维图像」处理,实证 CNN 能高效挖掘量价的局部形态信号,且训练速度远快于 RNN。本节讲清 CNN 的卷积、池化、感受野等机制,以及它在量价局部模式挖掘上的应用与陷阱。
内容来源:仓库研报 华泰 AI 系列第 15 篇(卷积神经网络),知识结构化整理。
⚠️ 学习提示:CNN 善抓「形态」,但金融里的「形态」远不如图像里的猫狗稳定。过度依赖某种历史形态可能过拟合,务必做多样本外检验。
阅读完本节,你应当能够:
CNN 最早在图像识别大放异彩——它能自动识别图像里的局部特征(边缘、纹理、形状),无需人工设计特征。这个能力同样适用于金融:一段量价序列里,「连续 3 天放量上涨」「长上影线伴随缩量」「急跌后地量横盘」这些都是局部形态,和图像里的「局部纹理」本质相似。
RNN 虽能处理时序,但它是「整体建模」——逐时间步累积,难以聚焦于某个短窗口内的形态。CNN 则用卷积核在序列上滑动,每次只看一个短窗口(如 5 天),专门抽取局部模式,再用多层堆叠把局部模式组合成全局模式。这种「先局部后全局」的层次化特征抽取,正是 CNN 的核心优势。
华泰 AI 系列第 15 篇正是基于这个动机,把 CNN 引入选股。它把量价序列看作「一维图像」,用一维卷积(1D Convolution)挖掘局部模式,实证在量价特征输入下,CNN 的预测 IC 与训练效率都不输 RNN,甚至在某些场景更优。
卷积运算的核心是卷积核(kernel,也叫 filter),它是一个小的权重矩阵(一维卷积里是一个小权重向量)。卷积核在输入序列上滑动,每滑动到一个位置,就与对应窗口的输入做点积,得到一个输出值。所有位置的输出拼起来,构成特征图(feature map)。
以一维卷积为例:输入序列长度为 T(如 30 天),卷积核大小为 K(如 5 天),步长(stride)为 1。卷积核从序列起点开始,每次覆盖 5 个时间步,做点积得到一个数,然后向右滑一格,再做一个点积,直到滑到序列末尾。最终输出长度为 T-K+1(如 26)的特征图。
输入序列: [x1, x2, x3, x4, x5, x6, ..., x30] 卷积核 K=5: [w1, w2, w3, w4, w5] 第 1 个位置: out1 = w1*x1 + w2*x2 + w3*x3 + w4*x4 + w5*x5 第 2 个位置: out2 = w1*x2 + w2*x3 + w3*x4 + w4*x5 + w5*x6 ...
关键性质:
卷积之后通常会接池化层(pooling),对特征图做下采样。两种常见池化:
池化的作用:
💡 直觉理解:如果卷积核像「侦探」在序列上找某种形态,那么池化就像「汇总报告」——它把侦探在每个小区域的发现压缩成「有/无」,让上层只关心「这个模式出现过没有」,而不纠结具体位置。
感受野(Receptive Field)指网络某一层的输出,依赖的原序列的范围。单层卷积核大小为 K 时,该层输出的每个值只依赖原序列的连续 K 个时间步——这是「局部感受野」。
但多层卷积堆叠后,感受野会逐层扩大:
这就是 CNN「先局部后全局」的层次化机制——浅层卷积核学简单的短周期形态(如 5 天内的放量),深层卷积核把这些短周期形态组合成长周期模式(如 13 天的趋势反转)。与 RNN 的「逐点累积」不同,CNN 是「窗口套窗口」地抽象。
一次卷积操作后,输出特征图的形状取决于几个参数:
| 参数 | 含义 | 影响 |
|---|---|---|
| 输入长度 T | 序列长度(如 30 天) | 越长信息越多,计算越慢 |
| 卷积核大小 K | 核覆盖的窗口(如 5) | 越大感受野越大,参数越多 |
| 步长 stride | 每次滑动几格(如 1) | 越大输出越短,信息损失多 |
| 填充 padding | 序列两端补零 | 控制输出长度,保留边界信息 |
| 卷积核数 N | 输出通道数(如 64) | 越大学的模式越多,参数越多 |
输出长度计算:(T - K + 2*padding) / stride + 1。一个典型量价 CNN 会用 2-3 层卷积+池化,逐层降维,最后把特征图展平接全连接层输出预测。
华泰 AI 15 的应用范式:
实证结论:
CNN 虽强,但也有局限:
这些局限在 AlphaNet(下一节)里得到部分解决——AlphaNet 把 CNN 的卷积思想与人工特征生成函数结合,既保留局部模式抽取的高效,又注入金融先验。
⚠️ 学习提示:CNN 在选股里的价值,在于它提供了一种与 RNN 互补的视角——RNN 看「序列演化」,CNN 看「局部形态」。实践中常把两者结合(如 CNN 提取局部特征,再喂给 LSTM 建模时序),华泰 AI 系列后续也探索了这种混合结构。
下一节,我们看本章的重头戏——AlphaNet。它是华泰自研的因子挖掘网络,把 CNN 的卷积思想与金融特征生成函数(return/std/correlation 等)结合,实现了「端到端从原始量价数据自动挖掘因子」的飞跃。