第 1 章 · 01 ML4T 是什么 本节摘要:本节是全书的总开关,先讲清「ML4T(Machine Learning for Trading,机器学习驱动的算法交易)」到底指什么——它不是某一个神奇的预测模型,而是把机器学习当作投资流程中的一个环节,嵌入到「数据→特征→模型→信号→组合→回测→执行」的端到端工作流里。本节对比 ML4T 与传统主观投资、与规则型量化交易的差异,讲明 ML 在投资流程中能做什么、不能做什么,并交代本教程为何从原书 23 章中精选出「数据→因子→验证→建模→端到端→树模型→深度强化学习」这条主线。读完本节,你能用一句话向外行说清 ML4T 是什么,并知道自己接下来要学什么。 内容来源:原项目根 、 章前说明,汉化并套用体系化模板。
本节摘要:本节是全书的总开关,先讲清「ML4T(Machine Learning for Trading,机器学习驱动的算法交易)」到底指什么——它不是某一个神奇的预测模型,而是把机器学习当作投资流程中的一个环节,嵌入到「数据→特征→模型→信号→组合→回测→执行」的端到端工作流里。本节对比 ML4T 与传统主观投资、与规则型量化交易的差异,讲明 ML 在投资流程中能做什么、不能做什么,并交代本教程为何从原书 23 章中精选出「数据→因子→验证→建模→端到端→树模型→深度强化学习」这条主线。读完本节,你能用一句话向外行说清 ML4T 是什么,并知道自己接下来要学什么。
内容来源:原项目根
README.md、01_machine_learning_for_trading/章前说明,汉化并套用体系化模板。
⚠️ 风险提示:本节所述方法仅供学习研究,机器学习模型在金融市场并不必然盈利,历史回测不代表未来收益,实盘需额外考虑滑点、容量与合规。
阅读完本节,你应当能够:
很多人初听「机器学习做交易」,脑中浮现的是「训练一个神经网络预测股价涨跌,然后印钞」。这是误解。原书作者 Stefan Jansen 在 README.md 里反复强调一句核心论断:ML4T 把机器学习视为一个过程中的关键环节,而不是独立练习(frames ML as a critical element in a process rather than a standalone exercise)。
换句话说,ML4T 是一套端到端工作流:从提出策略想法、采集数据、构造特征、训练与调参模型,到把模型预测转成交易信号、设计组合规则、用回测引擎模拟历史绩效,再到实盘执行与持续迭代。模型只是其中一环。
💡 核心心法:不要问「哪个模型预测最准」,要问「数据是否干净、特征是否有经济学含义、信号能否覆盖交易成本、回测是否避免了未来函数」。模型只是把信号放大的透镜,透镜再好,镜前没有光(数据)也是黑屏。
原书第 1 章把 ML 在投资业崛起的背景归结为几个相互叠加的趋势:
| 趋势 | 具体表现 | 对 ML4T 的意义 |
|---|---|---|
| 数据爆发 | tick 级订单流、SEC XBRL 财报、卫星图、社交情感 | ML 擅长从高维噪声数据中提取信号 |
| 算力下沉 | GPU、TPU、云端按需计费 | 训练大模型、跑大规模回测变得经济可行 |
| 算法进步 | 梯度提升、CNN/RNN、强化学习 | 处理非线性、时序、决策序列的能力大幅提升 |
| 市场电子化 | 订单簿全电子化、手续费趋零 | 算法策略的执行成本持续下降 |
💡 核心心法:趋势叠加的结果是——「信息优势」不再来自独家消息,而来自「对公开/半公开数据的更高维加工能力」。这正是 ML 的用武之地。
投资业历史上主要有两种决策方式:主观判断(discretionary)与规则量化(quantitative rules)。ML4T 是第三条路——学习驱动的量化。三者对比如下。
| 维度 | 主观投资 | 规则量化 | ML4T |
|---|---|---|---|
| 决策依据 | 经验、直觉、路演 | 人工设定的 if-then 规则 | 从数据学到的函数 |
| 可复现性 | 弱,难复盘 | 强,完全可复现 | 强,种子固定即可复现 |
| 可扩展性 | 难,依赖个人 | 中,规则多了互相打架 | 高,可同时处理上千特征 |
| 典型失败模式 | 情绪化、风格漂移 | 过拟合规则、僵化 | 过拟合模型、数据窥探 |
⚠️ 警告:ML4T 不是万能药。它解决了「规则人工写不过来」的问题,但引入了「模型可能学到了噪声」的新问题。过拟合与数据窥探是 ML4T 的两大心腹大患,本书第 6 章(交叉验证)与第 8 章(Deflated Sharpe)专门对付它们。
原书把投资流程拆成如下环节,ML 在其中各有用武之地:
| 环节 | ML 能做什么 | 本教程对应章节 |
|---|---|---|
| 数据采集 | 用 NLP/CV 从另类数据提取结构化信息 | 第 2~3 章 |
| 特征/因子 | 自动学习表征、降维 | 第 4 章 |
| 模型训练 | 收益预测、分类、聚类 | 第 7、9、10 章 |
| 组合构建 | 均值方差、层次风险平价 HRP | 第 5、10 章 |
| 回测/评估 | 时序交叉验证、Deflated Sharpe | 第 6、8 章 |
| 执行 | 强化学习交易 Agent | 第 10 章 |
原书有 23 章、150+ 个 notebook,信息密度极高。本教程按「懂全景 → 拿数据 → 炼因子 → 验策略 → 建流程 → 上线性 → 跑通端到端 → 上树模型 → 上深度学习与强化学习」的递进,把 23 章收敛为 10 章:
💡 核心心法:这条主线刻意让「数据与因子」先于「模型」,因为金融机器学习的瓶颈几乎从来不是模型,而是数据与特征。先练好基本功,再上大模型,这是本书作者反复强调的工程顺序。
下一节,我们看 从数据到决策的闭环——把本节抽象的「流程」展开成具体步骤,讲清每一步在做什么、上下游如何衔接。