量化进阶 · 组合与机器学习 · 第 5 期

策略不是试出来的,
是证出来的

quant research methodology · from hypothesis to validation

新手"调参数试出能赚钱的组合",老手"先写假设再证伪"。量化研究的标准流程是假设→数据→特征→回测→稳健性→样本外→实盘,每一步都有专属陷阱。一句话——跳过哪步,哪步就埋雷,回测好看实盘崩,多半是某步漏了。
⏱ 约 12 分钟 🎯 想做量化研究的人 📦 源:ht-quant-methodology

01反共识:先有假设,再去找数据

很多人拿到数据就开始挖因子,挖到 IC 高的就上。这是"数据窥探",挖出来的高 IC 多半是过拟合。

正确顺序反过来:先写"我假设动量在 A 股有效,因为散户追涨杀跌",再去找数据验证。假设先行的好处是——证伪时你知道是假设错了,不是参数没调好。没有假设的研究,调参调到 IC 高,你不知道是真信号还是噪声。

假设 H → 可证伪预测 → 数据检验 → 接受/拒绝 H

这是波普尔的可证伪性在量化里的应用。能被证伪的假设才是科学假设,"市场会涨"这种不能证伪的不是假设是占卜。每个策略上线前,问自己一句:"什么情况能证明我错了?"——答不上来,就别上。

先有假设,
再去找数据。
灏天文库 · 量化进阶·组合与机器学习 P.13

02研究流程图闯关:把步骤排对

下面 7 个研究步骤被打乱了。按正确顺序点击排到下方轨道,看排对几步、漏哪步会出什么事。

🧪 研究流程闯关
点击步骤按正确顺序排到轨道,排错会提示陷阱。
已排步骤
0/7
流程评分
—

03每步的陷阱

假设

不可证伪=占卜

"市场会涨"不能证伪。要写成"动量股 5 日后跑赢大盘 2%",能被数据拒绝才算假设。

数据

未来函数最致命

用了 t+1 才有的数据预测 t,回测必赢实盘必亏。检查每个字段的时间戳。

特征

过拟合样本

试 100 个因子挑 5 个 IC 高的,纯噪声也能挑出"显著"。用 Bonferroni 或样本外验证。

回测

幸存者偏差

用现存股票回测,退市股没算进去,收益系统性高估。必须用 point-in-time 股票池。

后面三步——稳健性(参数微调结果是否稳定)、样本外(留出数据验证)、实盘(小资金试跑)——是过拟合的最后一道防线。跳过样本外直接上实盘,等于不体检就上手术台。业界经验:回测年化 30%、样本外年化 15%、实盘年化 8% 是常见衰减,衰减>70% 就是过拟合。

回测 30,样本外 15,
实盘 8——正常衰减。
灏天文库 · 量化进阶·组合与机器学习 P.14

04带走这套清单

✅ 量化研究 6 条纪律

  1. 假设先行:先写可证伪预测,再找数据,别数据窥探。
  2. 查未来函数:每个字段对齐时间戳,回测里只用 t 之前的信息。
  3. 用 point-in-time 股票池:包含退市股,避免幸存者偏差。
  4. 多重检验校正:试了 N 个因子,显著性门槛要除以 N。
  5. 留样本外:30% 数据不碰,最后验证一次,崩了就是过拟合。
  6. 小资金实盘:回测再好也先纸面+小资金试跑,衰减>70% 立刻停。
跳过哪步,
哪步就埋雷。
灏天文库 · 量化进阶·组合与机器学习 P.15