量化进阶 · 组合与机器学习 · 第 2 期

ML 做交易,特征工程才是大头

features are 80% of the work · model is the rest

调三天模型涨 0.5 个 IC,调三天特征涨 5 个 IC——这是 ML 量化的常态。新手盯着 XGBoost 还是 LightGBM,老手盯着标签怎么打、IC 怎么算、特征去不去相关。一句话——模型是末端,特征是源头,源头脏了末端再花哨也没用。
⏱ 约 13 分钟 🎯 想用 ML 做策略的人 📦 源:ML-for-Algorithmic-Trading

01反共识:模型不重要,标签才重要

"我用 LSTM 预测涨跌"——这句话本身就错了。预测什么、预测多远、用什么当标签,比用什么模型重要十倍。

标签不是"明天涨/跌"那么简单。三分类(涨/平/跌)还是连续收益? horizon 选 1 天还是 5 天?要不要剔除停牌?要不要做行业中性化?这些决定你模型学的是什么。标签错了,模型越准越亏——它学对了你不想预测的东西。

IC = corr(ŷ, y) · sign(mean(ŷ·y))

IC(信息系数)才是 ML 量化的核心指标,不是准确率。准确率 60% 的模型可能 IC 只有 0.02——因为预测对的方向幅度小、错的方向幅度大,照样亏。IC 直接衡量"预测值和真实收益的相关性",IC>0.05 才有交易价值。

模型是末端,
特征是源头。
灏天文库 · 量化进阶·组合与机器学习 P.04

02特征工程闯关:选特征看 IC 和过拟合率

6 个候选特征,每个有真实 IC 和"过拟合倾向"。勾选组合,看组合 IC 和过拟合率怎么变——选得多不一定好,相关特征会互相稀释。

🧪 特征工程闯关器
勾选特征,看组合 IC(越高越好)与过拟合率(越低越好)。
组合 IC
—
过拟合率
—
综合评分
—

03特征工程的四道关

去相关

相关特征互相稀释

两个 IC=0.05 的相关特征,组合 IC 不是 0.1 而是 0.05。先聚类去冗余,每类留一个。

去未来信息

标签泄漏最致命

用 t+5 收益当标签,特征就只能用 t 之前的信息。归一化窗口、滚动统计都要小心。

稳定性

IC 衰减要慢

样本外 IC 衰减>50% 的特征直接扔。看 IC 时序的 Sharpe,比看均值更诚实。

中性化

剥离已知风险

特征对行业、市值中性化后还有 IC 才算真信号。否则只是行业 beta 的伪装。

这四道关是 ML 量化的"特征流水线"。没过这四关的特征,模型再强也是给垃圾做精装修。业界经验:特征工程占 ML 量化工作量的 70-80%,模型选择和调参占剩下的 20-30%——比例反着看,因为模型那部分容易调出成就感。

给垃圾做精装修,
还是垃圾。
灏天文库 · 量化进阶·组合与机器学习 P.05

04带走这套清单

✅ 特征工程 6 条铁律

  1. 先定标签再选特征:标签定义你要预测什么,特征服务于标签。
  2. 用 IC 不用准确率:IC>0.05 才有交易价值,准确率高 IC 低照样亏。
  3. 相关特征先聚类去冗余:每类留一个,避免互相稀释和多重共线性。
  4. 严格防泄漏:标签 horizon 内的特征一律禁用,归一化用滚动窗口。
  5. 看 IC 时序 Sharpe:均值高但波动大的特征是噪声,衰减快的扔掉。
  6. 样本外必测:训练 IC 高、验证 IC 崩,就是过拟合,别自我安慰。
调模型三天涨半点,
调特征三天涨五点。
灏天文库 · 量化进阶·组合与机器学习 P.06