第 5 章 · 01 全连接神经网络


文档摘要

第 5 章 · 01 全连接神经网络 本节摘要:本节是深度学习选股的起点,讲清最基础的「全连接神经网络」(Multi-Layer Perceptron,MLP)。MLP 由输入层、若干隐藏层、输出层组成,每层神经元与上一层全部相连,通过非线性激活函数(ReLU/Sigmoid 等)学习因子之间的复杂非线性组合,再用反向传播算法(梯度下降)最小化预测误差。华泰 AI 系列第 8 篇把 MLP 引入选股,作为深度学习选股的基线模型——它相对第 4 章的传统机器学习(如 SVM、随机森林)能拟合更复杂的非线性关系,但也要面对梯度消失/爆炸、过拟合、可解释性弱等问题。本节讲清 MLP 的结构、激活函数、训练过程,以及它在选股里的应用范式与局限,为后面 RNN/CNN/AlphaNet 打底。

第 5 章 · 01 全连接神经网络

本节摘要:本节是深度学习选股的起点,讲清最基础的「全连接神经网络」(Multi-Layer Perceptron,MLP)。MLP 由输入层、若干隐藏层、输出层组成,每层神经元与上一层全部相连,通过非线性激活函数(ReLU/Sigmoid 等)学习因子之间的复杂非线性组合,再用反向传播算法(梯度下降)最小化预测误差。华泰 AI 系列第 8 篇把 MLP 引入选股,作为深度学习选股的基线模型——它相对第 4 章的传统机器学习(如 SVM、随机森林)能拟合更复杂的非线性关系,但也要面对梯度消失/爆炸、过拟合、可解释性弱等问题。本节讲清 MLP 的结构、激活函数、训练过程,以及它在选股里的应用范式与局限,为后面 RNN/CNN/AlphaNet 打底。

内容来源:仓库研报 华泰 AI 系列第 8 篇(全连接神经网络),知识结构化整理。

⚠️ 学习提示:神经网络容易在训练集上「学得太好」而过拟合,尤其金融数据信噪比低。务必配合第 1 章讲的时序交叉验证与样本外检验,不要被训练集指标迷惑。

学习目标

阅读完本节,你应当能够:

  1. 画出**全连接网络(MLP)**的结构并说清前向传播过程。
  2. 解释激活函数(ReLU/Sigmoid/tanh)的作用与各自优缺点。
  3. 说清梯度消失/爆炸的成因与应对方法。
  4. 描述反向传播与梯度下降的训练流程。
  5. 理解 MLP 作为选股基线模型的应用范式与局限。

一、为什么需要神经网络:从线性到非线性

第 4 章讲的传统机器学习方法(线性回归、SVM、决策树等)能处理选股问题,但有一个共同局限:对因子间复杂非线性组合的刻画能力有限。比如「低 PE + 高 ROE + 低波动」三者同时成立才有效,这种「条件组合」关系,线性模型很难捕捉,人工构造特征又费时。

神经网络的核心价值就是自动学习特征间的高阶非线性组合。一个足够宽、足够深的 MLP,理论上可以逼近任意连续函数(万能逼近定理)。在选股里,这意味着它能自动发现「哪些因子在什么条件下组合起来有用」,而不用人工穷举。

华泰 AI 系列第 8 篇正是基于这个动机,把全连接神经网络引入选股,作为深度学习选股的基线。它证明了 MLP 在量价因子输入下,能比传统机器学习方法(如逻辑回归、SVM)取得更高的预测精度(以 IC 衡量),从而为后续更复杂的 RNN/CNN/AlphaNet 结构奠定基础。

二、MLP 的结构:层、神经元与连接

一个全连接神经网络由三部分组成:

  • 输入层(Input Layer):接收特征向量。选股场景下,输入通常是股票在每个时间点的多个因子值(如 PE、动量、波动率等),构成一个 N 维向量。
  • 隐藏层(Hidden Layers):一层或多层,每层有若干神经元。每个神经元与上一层所有神经元相连(故称「全连接」),连接权重代表特征组合的系数。
  • 输出层(Output Layer):给出预测结果。选股通常是回归任务(预测未来收益率)或多分类任务(预测涨跌分组)。

前向传播的计算过程,以一个隐藏层神经元为例:

z = w1*x1 + w2*x2 + ... + wn*xn + b # 线性组合 a = activation(z) # 非线性激活

其中 w 是权重,b 是偏置,activation 是激活函数。整层神经元堆叠起来,可以用矩阵运算表示:a = activation(W*x + b),W 是权重矩阵。多层堆叠后,网络就能学习到因子间层层组合的复杂关系。

三、激活函数:让网络拥有非线性

如果没有激活函数,多层线性组合的结果仍是线性,网络再深也只能拟合线性关系,失去意义。激活函数引入非线性,是神经网络的灵魂。三种常见激活函数:

激活函数 公式描述 优点 缺点
Sigmoid 把任意实数压缩到 (0,1) 输出可解释为概率 容易饱和、梯度消失、非零中心
tanh 把任意实数压缩到 (-1,1) 零中心化,收敛比 Sigmoid 快 仍会饱和、梯度消失
ReLU 小于 0 输出 0,大于 0 输出原值 计算简单、缓解梯度消失、收敛快 「死亡 ReLU」(神经元永久输出 0)

💡 实战心法:隐藏层几乎都用 ReLU(或其变体 Leaky ReLU),因为它的梯度在正区间恒为 1,能有效缓解梯度消失,训练速度快。Sigmoid 主要用于输出层(二分类概率)或门控结构(后续 RNN 会看到)。直接在隐藏层用 Sigmoid 是新手常见错误,会拖慢甚至卡住训练。

四、梯度消失与梯度爆炸

反向传播通过链式法则把误差从输出层往回传,逐层计算梯度以更新权重。但当网络较深、激活函数选择不当时,梯度在反向传播中会逐层衰减或放大:

  • 梯度消失(Vanishing Gradient):梯度逐层缩小到接近 0,底层权重几乎不更新,网络学不到东西。Sigmoid/tanh 因饱和区梯度接近 0,是主要原因。
  • 梯度爆炸(Gradient Explosion):梯度逐层放大到极大值,权重剧烈震荡,训练发散。

两者的数学根源都在链式法则中的连乘效应——梯度是各层导数的乘积,导数小于 1 连乘趋于 0,大于 1 连乘趋于无穷。

常见应对手段:

  1. 用 ReLU 替代 Sigmoid:正区间梯度恒为 1,有效缓解消失。
  2. 批归一化(Batch Normalization):把每层输入归一化到均值 0、方差 1,稳定梯度流。
  3. 残差连接(ResNet):跨层直连,让梯度有「高速公路」可走(后续 AlphaNet 也有类似设计)。
  4. 梯度裁剪(Gradient Clipping):把过大的梯度截断,防爆炸(RNN 常用)。

五、反向传播与训练流程

神经网络通过反向传播算法(Backpropagation)学习权重,其本质是微积分里的链式法则。整个训练流程是一个迭代循环:

几个关键概念:

  • 损失函数(Loss):衡量预测值与真实值的差距。选股回归任务常用 MSE(均方误差);分类任务常用交叉熵
  • 优化器(Optimizer):决定如何用梯度更新权重。常用 Adam(自适应学习率,收敛快、调参少),也可用 SGD+动量。
  • 学习率(Learning Rate):权重更新的步长,太大学不稳,太小学得慢,通常在 1e-4 到 1e-2 之间调。
  • 批大小(Batch Size):每次迭代用多少样本,影响梯度估计的噪声与显存占用。
  • 轮数(Epoch):遍历整个训练集的次数,过多会过拟合,需配合早停(Early Stopping)。

六、MLP 在选股中的应用范式

华泰 AI 8 给出的 MLP 选股范式相当典型,后续 RNN/CNN/AlphaNet 大体沿用:

  1. 输入:每只股票在每个调仓日的多个因子值(去极值、标准化、行业中性化预处理,见第 2 章)。
  2. 标签:未来一段时间的收益率(如未来 10 日收益),或按截面分组的类别。
  3. 网络结构:输入层(因子数)→ 2-3 个隐藏层(每层 64-256 神经元)→ 输出层(1 个预测值)。
  4. 训练:用历史数据训练,时序切分(训练集早、验证集中、测试集晚),防止未来函数。
  5. 预测与选股:用训练好的网络对当前截面打分,选高分股票构建组合。

华泰 AI 8 的实证结论是:MLP 在量价因子输入下,预测 IC 高于传统机器学习方法(逻辑回归、SVM、朴素贝叶斯),分层回测多头组合的超额收益也更优。这印证了神经网络学习非线性组合的能力。

七、MLP 的局限与改进方向

MLP 虽是基线,但有几个明显局限,这正是后续模型要解决的:

  • 不处理时序结构:MLP 把每个时间点的因子值独立看待,无法利用「过去 N 天的因子序列」。这催生了 RNN/LSTM(第 02 节)。
  • 不挖掘局部模式:MLP 不能像人眼识别图像局部特征那样发现量价形态。这催生了 CNN(第 03 节)。
  • 特征工程依赖重:MLP 还是吃人工构造的因子,不会自动从原始量价数据生成特征。这催生了 AlphaNet(第 04 节)。
  • 过拟合风险高:参数多、金融数据信噪比低,稍不注意就过拟合。需配合 Dropout、正则化、早停、时序交叉验证。

⚠️ 学习提示:MLP 是深度学习选股的「最小可行模型」。理解它之后,后续每个更复杂模型(RNN/CNN/AlphaNet)都可以看作「针对 MLP 某个局限的定向改进」,脉络会非常清晰。

本节要点回顾

  1. 动机:MLP 自动学习因子间的复杂非线性组合,弥补传统机器学习对条件组合关系刻画不足的局限。
  2. 结构:输入层 → 隐藏层(全连接 + 激活函数)→ 输出层;前向传播 a = activation(W*x + b)
  3. 激活函数:隐藏层首选 ReLU(缓解梯度消失、收敛快);Sigmoid 主要用于输出层或门控。
  4. 梯度消失/爆炸:链式法则连乘导致;应对为 ReLU、批归一化、残差连接、梯度裁剪。
  5. 训练流程:前向传播算预测 → 算损失 → 反向传播算梯度 → 梯度下降更新权重;关键超参为学习率、批大小、轮数。
  6. 选股范式:因子输入 → MLP → 预测收益 → 截面打分选股;华泰 AI 8 证明 MLP 优于传统 ML。
  7. 局限:不处理时序(→ RNN)、不挖局部模式(→ CNN)、依赖人工特征(→ AlphaNet)、易过拟合。

下一节,我们看循环神经网络(RNN/LSTM)——它专为时序数据设计,能利用「过去 N 天的因子序列」捕捉 MLP 错过的时序依赖。


发布者: 作者: 灏天文库 转发
评论区 (0)
U