第 5 章 · 01 全连接神经网络 本节摘要:本节是深度学习选股的起点,讲清最基础的「全连接神经网络」(Multi-Layer Perceptron,MLP)。MLP 由输入层、若干隐藏层、输出层组成,每层神经元与上一层全部相连,通过非线性激活函数(ReLU/Sigmoid 等)学习因子之间的复杂非线性组合,再用反向传播算法(梯度下降)最小化预测误差。华泰 AI 系列第 8 篇把 MLP 引入选股,作为深度学习选股的基线模型——它相对第 4 章的传统机器学习(如 SVM、随机森林)能拟合更复杂的非线性关系,但也要面对梯度消失/爆炸、过拟合、可解释性弱等问题。本节讲清 MLP 的结构、激活函数、训练过程,以及它在选股里的应用范式与局限,为后面 RNN/CNN/AlphaNet 打底。
本节摘要:本节是深度学习选股的起点,讲清最基础的「全连接神经网络」(Multi-Layer Perceptron,MLP)。MLP 由输入层、若干隐藏层、输出层组成,每层神经元与上一层全部相连,通过非线性激活函数(ReLU/Sigmoid 等)学习因子之间的复杂非线性组合,再用反向传播算法(梯度下降)最小化预测误差。华泰 AI 系列第 8 篇把 MLP 引入选股,作为深度学习选股的基线模型——它相对第 4 章的传统机器学习(如 SVM、随机森林)能拟合更复杂的非线性关系,但也要面对梯度消失/爆炸、过拟合、可解释性弱等问题。本节讲清 MLP 的结构、激活函数、训练过程,以及它在选股里的应用范式与局限,为后面 RNN/CNN/AlphaNet 打底。
内容来源:仓库研报 华泰 AI 系列第 8 篇(全连接神经网络),知识结构化整理。
⚠️ 学习提示:神经网络容易在训练集上「学得太好」而过拟合,尤其金融数据信噪比低。务必配合第 1 章讲的时序交叉验证与样本外检验,不要被训练集指标迷惑。
阅读完本节,你应当能够:
第 4 章讲的传统机器学习方法(线性回归、SVM、决策树等)能处理选股问题,但有一个共同局限:对因子间复杂非线性组合的刻画能力有限。比如「低 PE + 高 ROE + 低波动」三者同时成立才有效,这种「条件组合」关系,线性模型很难捕捉,人工构造特征又费时。
神经网络的核心价值就是自动学习特征间的高阶非线性组合。一个足够宽、足够深的 MLP,理论上可以逼近任意连续函数(万能逼近定理)。在选股里,这意味着它能自动发现「哪些因子在什么条件下组合起来有用」,而不用人工穷举。
华泰 AI 系列第 8 篇正是基于这个动机,把全连接神经网络引入选股,作为深度学习选股的基线。它证明了 MLP 在量价因子输入下,能比传统机器学习方法(如逻辑回归、SVM)取得更高的预测精度(以 IC 衡量),从而为后续更复杂的 RNN/CNN/AlphaNet 结构奠定基础。
一个全连接神经网络由三部分组成:
前向传播的计算过程,以一个隐藏层神经元为例:
z = w1*x1 + w2*x2 + ... + wn*xn + b # 线性组合 a = activation(z) # 非线性激活
其中 w 是权重,b 是偏置,activation 是激活函数。整层神经元堆叠起来,可以用矩阵运算表示:a = activation(W*x + b),W 是权重矩阵。多层堆叠后,网络就能学习到因子间层层组合的复杂关系。
如果没有激活函数,多层线性组合的结果仍是线性,网络再深也只能拟合线性关系,失去意义。激活函数引入非线性,是神经网络的灵魂。三种常见激活函数:
| 激活函数 | 公式描述 | 优点 | 缺点 |
|---|---|---|---|
| Sigmoid | 把任意实数压缩到 (0,1) | 输出可解释为概率 | 容易饱和、梯度消失、非零中心 |
| tanh | 把任意实数压缩到 (-1,1) | 零中心化,收敛比 Sigmoid 快 | 仍会饱和、梯度消失 |
| ReLU | 小于 0 输出 0,大于 0 输出原值 | 计算简单、缓解梯度消失、收敛快 | 「死亡 ReLU」(神经元永久输出 0) |
💡 实战心法:隐藏层几乎都用 ReLU(或其变体 Leaky ReLU),因为它的梯度在正区间恒为 1,能有效缓解梯度消失,训练速度快。Sigmoid 主要用于输出层(二分类概率)或门控结构(后续 RNN 会看到)。直接在隐藏层用 Sigmoid 是新手常见错误,会拖慢甚至卡住训练。
反向传播通过链式法则把误差从输出层往回传,逐层计算梯度以更新权重。但当网络较深、激活函数选择不当时,梯度在反向传播中会逐层衰减或放大:
两者的数学根源都在链式法则中的连乘效应——梯度是各层导数的乘积,导数小于 1 连乘趋于 0,大于 1 连乘趋于无穷。
常见应对手段:
神经网络通过反向传播算法(Backpropagation)学习权重,其本质是微积分里的链式法则。整个训练流程是一个迭代循环:
几个关键概念:
华泰 AI 8 给出的 MLP 选股范式相当典型,后续 RNN/CNN/AlphaNet 大体沿用:
华泰 AI 8 的实证结论是:MLP 在量价因子输入下,预测 IC 高于传统机器学习方法(逻辑回归、SVM、朴素贝叶斯),分层回测多头组合的超额收益也更优。这印证了神经网络学习非线性组合的能力。
MLP 虽是基线,但有几个明显局限,这正是后续模型要解决的:
⚠️ 学习提示:MLP 是深度学习选股的「最小可行模型」。理解它之后,后续每个更复杂模型(RNN/CNN/AlphaNet)都可以看作「针对 MLP 某个局限的定向改进」,脉络会非常清晰。
a = activation(W*x + b)。下一节,我们看循环神经网络(RNN/LSTM)——它专为时序数据设计,能利用「过去 N 天的因子序列」捕捉 MLP 错过的时序依赖。