features are 80% of the work · model is the rest
"我用 LSTM 预测涨跌"——这句话本身就错了。预测什么、预测多远、用什么当标签,比用什么模型重要十倍。
标签不是"明天涨/跌"那么简单。三分类(涨/平/跌)还是连续收益? horizon 选 1 天还是 5 天?要不要剔除停牌?要不要做行业中性化?这些决定你模型学的是什么。标签错了,模型越准越亏——它学对了你不想预测的东西。
IC(信息系数)才是 ML 量化的核心指标,不是准确率。准确率 60% 的模型可能 IC 只有 0.02——因为预测对的方向幅度小、错的方向幅度大,照样亏。IC 直接衡量"预测值和真实收益的相关性",IC>0.05 才有交易价值。
6 个候选特征,每个有真实 IC 和"过拟合倾向"。勾选组合,看组合 IC 和过拟合率怎么变——选得多不一定好,相关特征会互相稀释。
两个 IC=0.05 的相关特征,组合 IC 不是 0.1 而是 0.05。先聚类去冗余,每类留一个。
用 t+5 收益当标签,特征就只能用 t 之前的信息。归一化窗口、滚动统计都要小心。
样本外 IC 衰减>50% 的特征直接扔。看 IC 时序的 Sharpe,比看均值更诚实。
特征对行业、市值中性化后还有 IC 才算真信号。否则只是行业 beta 的伪装。
这四道关是 ML 量化的"特征流水线"。没过这四关的特征,模型再强也是给垃圾做精装修。业界经验:特征工程占 ML 量化工作量的 70-80%,模型选择和调参占剩下的 20-30%——比例反着看,因为模型那部分容易调出成就感。