第 4 章 · 01 线性模型 GLM 与逻辑回归


文档摘要

第 4 章 · 01 线性模型 GLM 与逻辑回归 本节摘要:本章进入 AI 选股的第一站——传统机器学习。本节从最基础也是最重要的广义线性模型 GLM讲起,核心是线性回归(用于预测收益)与逻辑回归(用于预测涨跌分类)。线性模型看似简单,却是机器学习选股的不可替代基线:它的系数可解释(每个因子贡献多少)、训练快、过拟合风险低,华泰人工智能系列第 2 篇正是用 GLM 作为整套 AI 选股体系的基准。本节讲清两件事:一是标签怎么打(回归用连续收益、分类用涨跌二分类)、特征怎么处理(标准化、中性化);二是线性模型的系数可解释性——它本身就是一种「自动化的因子合成」。读完本节,你掌握 AI 选股的标准基线,为后续 SVM、随机森林、Boosting 提供对比基准。

第 4 章 · 01 线性模型 GLM 与逻辑回归

本节摘要:本章进入 AI 选股的第一站——传统机器学习。本节从最基础也是最重要的广义线性模型 GLM讲起,核心是线性回归(用于预测收益)与逻辑回归(用于预测涨跌分类)。线性模型看似简单,却是机器学习选股的不可替代基线:它的系数可解释(每个因子贡献多少)、训练快、过拟合风险低,华泰人工智能系列第 2 篇正是用 GLM 作为整套 AI 选股体系的基准。本节讲清两件事:一是标签怎么打(回归用连续收益、分类用涨跌二分类)、特征怎么处理(标准化、中性化);二是线性模型的系数可解释性——它本身就是一种「自动化的因子合成」。读完本节,你掌握 AI 选股的标准基线,为后续 SVM、随机森林、Boosting 提供对比基准。

内容来源:仓库研报 华泰人工智能系列第 2 篇(广义线性模型),知识结构化整理。

⚠️ 学习提示:不要因为「线性」就轻视它。华泰 AI 2 的实证显示,在很多场景下线性模型的样本外表现接近甚至超过复杂模型——这是金融低信噪比场景下「简单稳健」的胜利。

学习目标

阅读完本节,你应当能够:

  1. 区分回归任务分类任务在选股里的不同标签设计。
  2. 写出线性回归逻辑回归的模型形式与损失函数。
  3. 说清系数可解释性如何让线性模型成为「自动因子合成」。
  4. 理解正则化(L1/L2)如何控制过拟合。
  5. 知道为什么线性模型是 AI 选股的必备基线

一、机器学习选股的基本范式

进入本章前,先厘清机器学习选股的范式。与第 2 章手工因子不同,机器学习把「因子→收益」的映射交给模型学:

关键要素:

  • 特征 X:因子值矩阵(每行一只股票,每列一个因子)。
  • 标签 Y:未来收益(回归)或涨跌(分类)。
  • 模型:从 X 学到 X → Y 的映射。
  • 预测:对未来时点打分,排序选股。

💡 核心心法:机器学习选股的本质,就是让模型自动学习第 2 章里人工设计的「因子合成」。线性模型是这套流程的最简版本,后续模型都是它的扩展。

二、标签设计:回归 vs 分类

标签 Y 的设计是机器学习选股的第一步,分两种思路:

回归任务:预测连续收益

Y = 未来 N 日涨跌幅(连续值,如 +3.5%、-1.2%)

直接预测收益的大小,用线性回归等连续模型。优点是信息量大(用到了收益的幅度),缺点是噪声大、对极值敏感。

分类任务:预测涨跌

Y = 0 或 1(0=跌,1=涨) 或者 Y = 0/1/2(三分类:跌/平/涨)

把收益离散化,预测涨跌方向。逻辑回归是分类任务的标准模型。优点是抗噪声(只关心方向)、与选股逻辑契合(分组就是按概率排序),缺点是损失了幅度信息。

华泰 AI 系列两种都用,但分类任务(尤其是二分类)更常见——因为它与「选前 N% 买入」的实战逻辑直接对应,而且抗噪声。

⚠️ 学习提示:标签设计里最大的陷阱是未来函数——计算「未来 N 日收益」必须用 shift(-N)(第 3 章第 04 节详讲),绝不能在训练时让模型看到当前时点的未来。打标签的代码必须严格审查。

三、线性回归:最简形式

线性回归假设 Y 是 X 的线性组合:

Y = β0 + β1·X1 + β2·X2 + ... + βN·XN + ε
  • βi:第 i 个因子的系数(权重)。
  • ε:误差项(模型无法解释的部分)。

训练目标:最小化残差平方和(MSE):

min sum( (Y - Ŷ)^2 )

这就是普通最小二乘 OLS。在选股场景,每个截面跑一次回归,β 就是「当期各因子的边际收益」——这与第 2 章因子合成里的「回归合成」完全是同一件事。

四、逻辑回归:分类的标准模型

逻辑回归(Logistic Regression)虽然名字带「回归」,实际是二分类模型。它先算出一个线性得分,再用 sigmoid 函数压缩到 (0, 1) 区间,表示「正类概率」:

得分 z = β0 + β1·X1 + ... + βN·XN 概率 p = 1 / (1 + exp(-z)) (sigmoid) 预测:若 p > 0.5 判正类(涨),否则负类(跌)

训练目标:最大化对数似然(等价于最小化 log-loss):

max sum( y·log(p) + (1-y)·log(1-p) )

逻辑回归在选股里的用法:

  • 预测概率 p:每只股票未来上涨的概率。
  • 按 p 排序:概率高的优先买入,这就是机器学习选股的标准流程。
  • 阈值分组:p > 0.6 进入「高概率组」、p < 0.4 进入「低概率组」。

💡 核心心法:逻辑回归输出的是「概率」,而非二元结论。实战中我们不直接用 0.5 阈值,而是按概率排序选前 20%——这与第 2 章分组选股的逻辑一致,只是分组依据从因子值变成了模型预测概率。

五、系数的可解释性:自动因子合成

线性模型最大的优势是系数可解释——每个 βi 直接告诉你「这个因子贡献多少」:

  • βi > 0:该因子正向贡献,因子值越大预测值越高。
  • |βi| 大小:因子重要性,绝对值越大贡献越大。
  • βi 显著性:t 检验显著,说明该因子的贡献不是偶然。

这等价于第 2 章讲的「截面回归合成」——线性模型本身就是一种自动化的因子合成,而且每个时点的 β 都反映当期因子的相对重要性。

模型 可解释性 备注
线性/逻辑回归 极高(直接看系数) AI 选股基线
SVM(线性核) 系数可看
决策树/随机森林 中(特征重要性) 第 03 节
Boosting 中(特征重要性) 第 04 节
神经网络 (黑箱) 第 5 章

可解释性在量化里至关重要——研报要解释、风控要审计、策略失效时要排查,线性模型的可解释性是它不可替代的优势

六、正则化:L1 与 L2 控制过拟合

OLS 与逻辑回归在因子多、因子相关时容易过拟合(系数估计波动大)。正则化通过给系数加约束来控制:

L2 正则(Ridge 岭回归)

在损失函数里加「系数平方和」惩罚项:

min MSE + λ · sum(β^2)

L2 让所有系数整体缩小,但不会变成零。λ 越大,收缩越强。Ridge 适合因子之间相关性高的场景(多重共线性),它能稳定系数估计。

L1 正则(Lasso)

加「系数绝对值」惩罚项:

min MSE + λ · sum(|β|)

L1 的特点是会把不重要的因子系数压到精确的零——即自动特征选择。Lasso 适合因子多但只有少数有效的场景,它帮你挑出真正有用的因子。

Elastic Net(L1 + L2)

两者结合,既有 L1 的稀疏性,又有 L2 的稳定性。

💡 关键观察:正则化强度 λ 是关键超参,要用时序交叉验证来选(第 04 节详讲)。λ 太小等于没正则化(过拟合),λ 太大模型欠拟合(预测力被压没)。

七、为什么线性模型是必备基线

华泰 AI 系列把 GLM 作为整套 AI 选股的基准,理由:

  1. 简单稳健:参数少、训练快、过拟合风险低,在低信噪比的金融市场里稳健性至关重要。
  2. 可解释:系数直接说明「模型在赌什么」,便于审计与失效排查。
  3. 样本外往往不输复杂模型:华泰 AI 2 的实证显示,在很多回测期,线性逻辑回归的样本外 IC/IR 接近甚至超过 SVM、随机森林——这与「没有免费午餐」定理一致。
  4. 基线作用:任何复杂模型必须先打败线性基线才算有价值。如果一个神经网络在样本外没能显著超过线性回归,它的复杂度就是浪费。

⚠️ 学习提示:很多初学者一上来就用 XGBoost 或神经网络,跳过线性基线,这是错的。先跑线性回归看 IC/IR,再上复杂模型比较——这是工业级机器学习选股的标准流程。复杂模型的价值不是「更准」,而是「能学到非线性」,但只有当线性模型漏掉的非线性足够多,复杂模型才值得。

八、Python 实战要点(sklearn)

实际用 sklearn 跑线性/逻辑回归的几个要点:

from sklearn.linear_model import LinearRegression, LogisticRegression, Ridge, Lasso # 回归任务:预测未来 N 日收益 model = LinearRegression() model.fit(X_train, Y_train) Y_pred = model.predict(X_test) # 分类任务:预测涨跌 clf = LogisticRegression(penalty='l2', C=1.0) # C 是 1/λ,C 越小正则越强 clf.fit(X_train, Y_train) prob = clf.predict_proba(X_test)[:, 1] # 取正类概率

几个工程细节:

  • 特征必须标准化:线性模型对尺度敏感,所有因子必须先 Z-score(第 2 章第 02 节)。
  • 训练/测试集按时间切:不能随机切,要用时序交叉验证(第 04 节)。
  • 样本均衡:涨跌分类若样本不均衡(牛市涨多于跌),可用 class_weight='balanced'
  • 系数监控:定期看 βi 的变化,因子贡献若剧烈变化,说明市场结构在变。

本节要点回顾

  1. 范式:机器学习选股 = 自动学习「因子→收益」映射,线性模型是最简版本。
  2. 标签设计:回归用未来 N 日收益(连续),分类用涨跌(0/1);分类更常见,因为抗噪声、契合选股逻辑。
  3. 线性回归:Y = β·X + ε,最小化 MSE;等价于第 2 章的截面回归合成。
  4. 逻辑回归:线性得分 + sigmoid 输出概率,最小化 log-loss;按概率排序选股,不直接用 0.5 阈值。
  5. 可解释性:βi 直接说明因子贡献方向与重要性,是线性模型不可替代的优势。
  6. 正则化:L2(Ridge)稳定系数、L1(Lasso)做特征选择、ElasticNet 兼具两者;λ 用时序交叉验证选。
  7. 必备基线:线性模型简单稳健、可解释、样本外不输复杂模型;任何复杂模型必须先打败线性基线。
  8. 工程要点:标准化特征、时序切分、样本均衡、监控系数。

下一节,我们看如何让线性模型处理非线性分类——支持向量机 SVM 与它的核技巧。


发布者: 作者: 灏天文库 转发
评论区 (0)
U