quant research methodology · from hypothesis to validation
很多人拿到数据就开始挖因子,挖到 IC 高的就上。这是"数据窥探",挖出来的高 IC 多半是过拟合。
正确顺序反过来:先写"我假设动量在 A 股有效,因为散户追涨杀跌",再去找数据验证。假设先行的好处是——证伪时你知道是假设错了,不是参数没调好。没有假设的研究,调参调到 IC 高,你不知道是真信号还是噪声。
这是波普尔的可证伪性在量化里的应用。能被证伪的假设才是科学假设,"市场会涨"这种不能证伪的不是假设是占卜。每个策略上线前,问自己一句:"什么情况能证明我错了?"——答不上来,就别上。
下面 7 个研究步骤被打乱了。按正确顺序点击排到下方轨道,看排对几步、漏哪步会出什么事。
"市场会涨"不能证伪。要写成"动量股 5 日后跑赢大盘 2%",能被数据拒绝才算假设。
用了 t+1 才有的数据预测 t,回测必赢实盘必亏。检查每个字段的时间戳。
试 100 个因子挑 5 个 IC 高的,纯噪声也能挑出"显著"。用 Bonferroni 或样本外验证。
用现存股票回测,退市股没算进去,收益系统性高估。必须用 point-in-time 股票池。
后面三步——稳健性(参数微调结果是否稳定)、样本外(留出数据验证)、实盘(小资金试跑)——是过拟合的最后一道防线。跳过样本外直接上实盘,等于不体检就上手术台。业界经验:回测年化 30%、样本外年化 15%、实盘年化 8% 是常见衰减,衰减>70% 就是过拟合。