第 2 章 · 04 因子合成方法


文档摘要

第 2 章 · 04 因子合成方法 本节摘要:前面两节讲了单因子的测试与评估,但实战中没人只用一个因子。多个因子各自有效但相关性低,合在一起往往比任何单一因子都稳定——这是多因子模型的核心动机。本节讲四种主流的因子合成方法:等权加权(最朴素,作为基准)、IC 加权(用历史预测力做权重)、回归合成(用截面回归拿系数)、主成分分析 PCA(用降维提取共同信号)。华泰多因子系列第 10 篇《因子合成方法实证分析》系统比较了这几种方法,核心结论是:合成显著优于单一,但合成方法之间的差异远小于合成 vs 不合成。读完本节,你能为多因子模型选择合适的合成方案。 内容来源:仓库研报 华泰多因子系列第 10 篇(因子合成方法实证分析),知识结构化整理。

第 2 章 · 04 因子合成方法

本节摘要:前面两节讲了单因子的测试与评估,但实战中没人只用一个因子。多个因子各自有效但相关性低,合在一起往往比任何单一因子都稳定——这是多因子模型的核心动机。本节讲四种主流的因子合成方法:等权加权(最朴素,作为基准)、IC 加权(用历史预测力做权重)、回归合成(用截面回归拿系数)、主成分分析 PCA(用降维提取共同信号)。华泰多因子系列第 10 篇《因子合成方法实证分析》系统比较了这几种方法,核心结论是:合成显著优于单一,但合成方法之间的差异远小于合成 vs 不合成。读完本节,你能为多因子模型选择合适的合成方案。

内容来源:仓库研报 华泰多因子系列第 10 篇(因子合成方法实证分析),知识结构化整理。

⚠️ 学习提示:合成方法的复杂度不等于效果——回归合成与 PCA 容易过拟合历史,实战中简单的等权或 IC 加权往往更稳健。

学习目标

阅读完本节,你应当能够:

  1. 解释为什么要合成(降低单一因子的波动,提升 IR)。
  2. 写出等权、IC 加权、回归合成的公式与步骤。
  3. 说清主成分 PCA 的思路与适用场景。
  4. 比较四种方法的优缺点与过拟合风险
  5. 知道工业级实战中默认选哪种合成方案。

一、为什么要合成

单因子各有失效期——价值因子在 2017-2020 成长股牛市跑输,动量因子在转折点反向亏损。但多个低相关的因子组合在一起,失效期错开,整体表现更稳:

合成的核心收益:

  • 降低波动:低相关因子的波动互相抵消,合成因子的 IR 通常高于任何单一因子。
  • 降低失效风险:某类因子失效时,其他因子可对冲。
  • 提升覆盖:单一因子只在某些股票上有效,合成后信号覆盖更广。

合成的关键问题:权重怎么定?这就是四种主流方法的分歧点。

二、方法一:等权加权(朴素基准)

把所有标准化后的因子值直接相加,每个因子权重相同。

合成因子 = (z1 + z2 + z3 + ... + zN) / N

等权看似粗糙,却有几个优点:

  • 无参数:不依赖任何历史估计,没有过拟合风险。
  • 稳健:不偏向任何因子,不会被某个因子在历史期的虚假高 IC 误导。
  • 透明:权重可解释、可重复。

华泰多因子 10 的实证显示,等权合成的 IR 往往能达到所有方法的中游水平——这是「笨办法但很难被打败」的基准。任何更复杂的方法,都必须先打败等权才算有价值。

💡 核心心法:等权是基准线。如果你的复杂方法在样本外没显著优于等权,就老老实实用等权。复杂不是优势,稳健才是。

三、方法二:IC 加权(用历史预测力做权重)

等权默认所有因子一样重要,但事实上有的因子预测力强(IC=0.08),有的弱(IC=0.03)。IC 加权用历史平均 IC 做权重,让强因子贡献更大。

权重_i = IC_i / sum(IC) 合成因子 = sum(权重_i × z_i)

更稳健的变体是 IC_IR 加权:用 IR(同时考虑稳定性)做权重。

权重_i = IR_i / sum(IR)

优点:直观、参数少、能反映因子的相对强弱。

缺点:

  • 历史 IC 不一定稳定,可能给某个近期偶然强的因子过高权重。
  • 没考虑因子之间的相关性——两个高度相关的因子若都给高权重,实际等于放大了同一信号。

工程上常做几个修补:用滚动窗口(如最近 6 个月)的 IC 而非全样本;对相关性高的因子先做正交化。

四、方法三:回归合成(截面回归)

把因子值当作自变量、未来收益当作因变量,在每个截面跑线性回归,回归系数就是合成权重。

未来收益_i = β0 + β1·z1_i + β2·z2_i + ... + βN·zN_i + ε 合成因子 = β1·z1 + β2·z2 + ... + βN·zN

回归合成的优势在于自动处理因子相关性——回归系数是「偏效应」,即控制了其他因子后的边际贡献。两个相关因子的权重会自动调整,不会重复计入。

缺点:

  • 过拟合风险大:回归系数在历史样本上最优,样本外可能失效。
  • 不稳定:因子之间相关性高时(多重共线性),系数估计波动剧烈。
  • 未来函数:若用未来收益回归,合成因子就用了未来信息,不能直接拿来做实战。

工业级做法是滚动回归:用过去 T 个月的回归系数作为下个月的合成权重,逐月滚动更新。

五、方法四:主成分分析(PCA 降维)

PCA 不是直接给权重,而是从多个相关因子里提取共同信号(第一主成分),作为合成因子。

对 N 个因子值的横截面做 PCA,取第一主成分 PC1 作为合成因子

PCA 的逻辑是:多个相关因子背后可能有共同的「驱动信号」,PC1 就是这个信号的最佳线性组合。

适用场景:

  • 因子之间高度相关(如同一类下的多个子因子,PE/PB/PS)。
  • 想把同类因子压缩成一个代表因子,再放入下一层合成。

缺点:

  • 不可解释:PC1 是数学构造,没有经济含义。
  • 不稳定:主成分结构在不同截面可能不同。
  • 方向不定:PC1 的正负号是随机的,需要人工对齐。

实战中 PCA 多用于同大类内部的因子压缩(如把 5 个估值因子合成一个估值综合因子),而不是跨大类合成。

六、四种方法的对比

方法 权重来源 优点 缺点 推荐场景
等权 固定 1/N 无参数、稳健、透明 忽略因子强弱差异 默认基准
IC 加权 历史 IC 反映因子强弱 不处理相关性 因子差异大、低相关
回归合成 截面回归系数 处理相关性 过拟合、不稳定 滚动回归、样本充足
PCA 主成分 降维、提共同信号 不可解释、方向不定 同类因子内部压缩

七、华泰多因子 10 的实证结论

华泰多因子系列第 10 篇用九大类因子做实证,核心发现:

  1. 合成显著优于单因子:无论用哪种合成方法,合成因子的 IR 都比最好的单一因子还高(低相关带来的多元化收益)。
  2. 方法间差异不大:等权、IC 加权、回归合成的样本外表现差异远小于合成 vs 不合成的差异。
  3. 复杂方法样本外不一定更好:回归合成与 PCA 在样本内最优,但样本外优势不明显,甚至有时被等权打败。

💡 关键观察:这个结论与机器学习领域的「没有免费午餐」一致——简单稳健的方法往往在金融这种低信噪比场景下更可靠。复杂度不等于效果,稳健才是优势。

八、工业级实战建议

基于华泰的实证与机构实战经验,推荐以下做法:

  • 默认用等权:作为基准线,任何更复杂的方法必须样本外显著打败等权才采用。
  • 大类内部先压缩,大类之间等权:如把 5 个估值因子用 PCA 或等权合成「估值综合因子」,再把估值/动量/质量等大类等权合成。这是两层结构,兼顾稳健与精细化。
  • 避免全样本优化:任何加权方法都用滚动窗口而非全样本,防止过拟合。
  • 关注因子的相关性结构:相关性会随时间变化,定期重新评估因子组合。
  • 保留可解释性:PCA 等不可解释的方法慎用,研报与实盘都需要能解释为什么这样加权。

⚠️ 学习提示:研报里常见的「最优合成方法」结论,往往是在样本内得出的。实战中,优先选最简单、最稳健的方案——这是华泰多因子 10 留下的最重要经验。

本节要点回顾

  1. 合成动机:低相关因子组合能降低波动、降低失效风险、提升覆盖,合成因子的 IR 通常高于任何单一因子。
  2. 等权:1/N 加权,无参数、稳健、透明,是难以打败的基准
  3. IC 加权:用历史 IC 或 IR 做权重,反映因子强弱,但不处理相关性。
  4. 回归合成:截面回归系数自动处理相关性,但过拟合风险大,需滚动窗口。
  5. PCA:主成分降维提取共同信号,用于同类因子内部压缩,跨大类慎用。
  6. 华泰实证:合成显著优于单因子,但合成方法间差异小;复杂方法样本外不一定更好。
  7. 实战建议:默认等权,大类内部压缩再大类等权,避免全样本优化,保留可解释性。

下一节,我们看多因子模型的另一面——Barra 结构化风险模型,把因子用于「风险拆解」而非「收益预测」。


发布者: 作者: 灏天文库 转发
评论区 (0)
U