第 1 章 · 01 ML4T 是什么


文档摘要

第 1 章 · 01 ML4T 是什么 本节摘要:本节是全书的总开关,先讲清「ML4T(Machine Learning for Trading,机器学习驱动的算法交易)」到底指什么——它不是某一个神奇的预测模型,而是把机器学习当作投资流程中的一个环节,嵌入到「数据→特征→模型→信号→组合→回测→执行」的端到端工作流里。本节对比 ML4T 与传统主观投资、与规则型量化交易的差异,讲明 ML 在投资流程中能做什么、不能做什么,并交代本教程为何从原书 23 章中精选出「数据→因子→验证→建模→端到端→树模型→深度强化学习」这条主线。读完本节,你能用一句话向外行说清 ML4T 是什么,并知道自己接下来要学什么。 内容来源:原项目根 、 章前说明,汉化并套用体系化模板。

第 1 章 · 01 ML4T 是什么

本节摘要:本节是全书的总开关,先讲清「ML4T(Machine Learning for Trading,机器学习驱动的算法交易)」到底指什么——它不是某一个神奇的预测模型,而是把机器学习当作投资流程中的一个环节,嵌入到「数据→特征→模型→信号→组合→回测→执行」的端到端工作流里。本节对比 ML4T 与传统主观投资、与规则型量化交易的差异,讲明 ML 在投资流程中能做什么、不能做什么,并交代本教程为何从原书 23 章中精选出「数据→因子→验证→建模→端到端→树模型→深度强化学习」这条主线。读完本节,你能用一句话向外行说清 ML4T 是什么,并知道自己接下来要学什么。

内容来源:原项目根 README.md01_machine_learning_for_trading/ 章前说明,汉化并套用体系化模板。

⚠️ 风险提示:本节所述方法仅供学习研究,机器学习模型在金融市场并不必然盈利,历史回测不代表未来收益,实盘需额外考虑滑点、容量与合规。

学习目标

阅读完本节,你应当能够:

  1. 用一句话说清 ML4T 的本质——把 ML 当作投资流程的环节而非孤立模型。
  2. 列举推动 ML 在投资业崛起的关键趋势(数据爆发、算力下沉、算法进步)。
  3. 区分 ML4T 与主观投资、规则量化的差异。
  4. 指出 ML 在投资流程中能解决哪些问题、对哪些问题无能为力。
  5. 复述本教程的精选主线与章节归属。

一、先把概念说清:ML4T 不是「一个模型」

很多人初听「机器学习做交易」,脑中浮现的是「训练一个神经网络预测股价涨跌,然后印钞」。这是误解。原书作者 Stefan Jansen 在 README.md 里反复强调一句核心论断:ML4T 把机器学习视为一个过程中的关键环节,而不是独立练习(frames ML as a critical element in a process rather than a standalone exercise)。

换句话说,ML4T 是一套端到端工作流:从提出策略想法、采集数据、构造特征、训练与调参模型,到把模型预测转成交易信号、设计组合规则、用回测引擎模拟历史绩效,再到实盘执行与持续迭代。模型只是其中一环。

💡 核心心法:不要问「哪个模型预测最准」,要问「数据是否干净、特征是否有经济学含义、信号能否覆盖交易成本、回测是否避免了未来函数」。模型只是把信号放大的透镜,透镜再好,镜前没有光(数据)也是黑屏。

二、推动 ML 走进投资业的三大趋势

原书第 1 章把 ML 在投资业崛起的背景归结为几个相互叠加的趋势:

趋势 具体表现 对 ML4T 的意义
数据爆发 tick 级订单流、SEC XBRL 财报、卫星图、社交情感 ML 擅长从高维噪声数据中提取信号
算力下沉 GPU、TPU、云端按需计费 训练大模型、跑大规模回测变得经济可行
算法进步 梯度提升、CNN/RNN、强化学习 处理非线性、时序、决策序列的能力大幅提升
市场电子化 订单簿全电子化、手续费趋零 算法策略的执行成本持续下降

💡 核心心法:趋势叠加的结果是——「信息优势」不再来自独家消息,而来自「对公开/半公开数据的更高维加工能力」。这正是 ML 的用武之地。

三、ML4T 与主观投资、规则量化的边界

投资业历史上主要有两种决策方式:主观判断(discretionary)规则量化(quantitative rules)。ML4T 是第三条路——学习驱动的量化。三者对比如下。

维度 主观投资 规则量化 ML4T
决策依据 经验、直觉、路演 人工设定的 if-then 规则 从数据学到的函数
可复现性 弱,难复盘 强,完全可复现 强,种子固定即可复现
可扩展性 难,依赖个人 中,规则多了互相打架 高,可同时处理上千特征
典型失败模式 情绪化、风格漂移 过拟合规则、僵化 过拟合模型、数据窥探

⚠️ 警告:ML4T 不是万能药。它解决了「规则人工写不过来」的问题,但引入了「模型可能学到了噪声」的新问题。过拟合与数据窥探是 ML4T 的两大心腹大患,本书第 6 章(交叉验证)与第 8 章(Deflated Sharpe)专门对付它们。

四、ML 在投资流程中的位置

原书把投资流程拆成如下环节,ML 在其中各有用武之地:

环节 ML 能做什么 本教程对应章节
数据采集 用 NLP/CV 从另类数据提取结构化信息 第 2~3 章
特征/因子 自动学习表征、降维 第 4 章
模型训练 收益预测、分类、聚类 第 7、9、10 章
组合构建 均值方差、层次风险平价 HRP 第 5、10 章
回测/评估 时序交叉验证、Deflated Sharpe 第 6、8 章
执行 强化学习交易 Agent 第 10 章

五、本教程的精选主线

原书有 23 章、150+ 个 notebook,信息密度极高。本教程按「懂全景 → 拿数据 → 炼因子 → 验策略 → 建流程 → 上线性 → 跑通端到端 → 上树模型 → 上深度学习与强化学习」的递进,把 23 章收敛为 10 章:

  • 数据与因子(第 1~4 章):全景 → 市场与基本面数据 → 另类数据 → Alpha 因子。
  • 验证与建模(第 5~7 章):策略评估 → 机器学习流程 → 线性模型选股。
  • 端到端实战与高阶模型(第 8~10 章):ML4T 工作流 → 树模型与梯度提升 → 无监督/深度/强化学习。

💡 核心心法:这条主线刻意让「数据与因子」先于「模型」,因为金融机器学习的瓶颈几乎从来不是模型,而是数据与特征。先练好基本功,再上大模型,这是本书作者反复强调的工程顺序。

本节要点回顾

  1. ML4T 的本质:把机器学习嵌入投资流程的端到端工作流,而非孤立的预测模型。
  2. 三大推手:数据爆发、算力下沉、算法进步,共同让 ML 成为投资业的竞争力来源。
  3. 三条路线:主观投资靠经验、规则量化靠人工规则、ML4T 靠从数据学到的函数。
  4. ML 的能力边界:擅长从高维噪声中提信号,不擅长应对制度断点与稀疏事件。
  5. 流程定位:ML 横跨数据、特征、模型、组合、回测、执行六大环节。
  6. 教程主线:10 章按「数据因子 → 验证建模 → 端到端实战与高阶」递进,先基本功后大模型。

下一节,我们看 从数据到决策的闭环——把本节抽象的「流程」展开成具体步骤,讲清每一步在做什么、上下游如何衔接。


发布者: 作者: 灏天文库 转发
评论区 (0)
U