第 8 章 · 02 遗传规划在 CTA 信号挖掘 本节摘要:本节讲遗传规划在 CTA(商品交易顾问)信号挖掘的应用。第 01 节把遗传规划用于选股——在股票横截面上挖因子,预测个股相对收益;本节把它用于 CTA——在单个商品/期货品种的时序上挖交易信号,预测涨跌方向择时开仓。华泰 AI 系列第 26 篇专门探讨了遗传规划在 CTA 信号挖掘的应用。核心差异在于:选股是「横截面排序」问题(同一天所有股票比较),CTA 是「单品种时序择时」问题(每个品种独立判断多空);因此算子集、适应度、评估方式都不同。CTA 信号常用技术指标型算子(突破、均线、动量),适应度用夏普比率或收益回撤比(而非 IC),且要特别关注交易成本与滑点。
本节摘要:本节讲遗传规划在 CTA(商品交易顾问)信号挖掘的应用。第 01 节把遗传规划用于选股——在股票横截面上挖因子,预测个股相对收益;本节把它用于 CTA——在单个商品/期货品种的时序上挖交易信号,预测涨跌方向择时开仓。华泰 AI 系列第 26 篇专门探讨了遗传规划在 CTA 信号挖掘的应用。核心差异在于:选股是「横截面排序」问题(同一天所有股票比较),CTA 是「单品种时序择时」问题(每个品种独立判断多空);因此算子集、适应度、评估方式都不同。CTA 信号常用技术指标型算子(突破、均线、动量),适应度用夏普比率或收益回撤比(而非 IC),且要特别关注交易成本与滑点。本节讲清遗传规划 CTA 信号挖掘与选股挖掘的差异、算子与适应度设计、以及实盘要点。读完本节,你理解遗传规划的跨场景迁移能力。
内容来源:仓库研报 华泰 AI 系列第 26 篇(遗传规划 CTA 信号),知识结构化整理。
⚠️ 学习提示:CTA 信号挖掘比选股因子挖掘更易过拟合——每个品种样本量少、噪声大、易拟合出「恰好穿越历史曲线」的伪信号。实盘前务必做样本外 + 参数敏感性 + 多品种稳健性检验。
阅读完本节,你应当能够:
第 01 节的遗传规划选股,本质是横截面问题:每个调仓日,对所有股票计算因子值,按值排序,选高分构建多头组合。目标是预测「个股相对市场的排序」。
CTA 信号挖掘是单品种时序问题:对每个商品/期货品种(如螺纹钢、原油),独立判断「现在该开多、开空还是空仓」,目标是预测「品种本身的涨跌方向」。
| 维度 | 选股因子挖掘 | CTA 信号挖掘 |
|---|---|---|
| 问题类型 | 横截面排序 | 单品种时序择时 |
| 预测目标 | 个股相对收益 | 品种绝对方向(多/空/空仓) |
| 评估对象 | 因子值与未来收益的相关(IC) | 信号触发的交易盈亏(夏普/回撤) |
| 样本结构 | 每天多个股票样本 | 每个品种一条时序 |
| 交易成本 | 调仓换手成本 | 开平仓 + 滑点 + 隔夜成本 |
| 可做空 | A股受限(融券) | 期货天然可双向 |
这些差异决定了 CTA 信号挖掘在算子、适应度、评估上的不同设计。
选股因子挖掘的算子偏「统计量」(收益率、标准差、相关系数),而 CTA 信号挖掘的算子偏「技术指标」,因为 CTA 本质是趋势跟踪/反转择时,技术指标天然适合。
常见 CTA 算子:
| 算子类型 | 代表 | 用途 |
|---|---|---|
| 均线类 | SMA、EMA、DMA | 趋势方向、金叉死叉 |
| 突破类 | max、min、突破信号 | 通道突破、新高新低 |
| 动量类 | ROC、momentum | 涨跌速度 |
| 波动类 | ATR、真实波动幅度 | 止损、仓位 |
| 形态类 | K线形态、缺口 | 反转/延续信号 |
| 组合算子 | and、or、if-then | 信号逻辑组合 |
CTA 信号的典型形态如:「如果价格突破过去 20 日最高价 且 波动率小于阈值,则开多」。遗传规划通过算子组合,自动搜索这类「条件触发」的信号。
选股用 IC(因子与收益的相关),但 CTA 信号不是「排序」而是「触发交易」,IC 不直接适用。CTA 信号挖掘的适应度通常是回测绩效指标:
| 适应度 | 含义 | 适用 |
|---|---|---|
| 夏普比率 | 年化收益 / 年化波动 | 综合收益与风险,最常用 |
| 卡尔马比率 | 年化收益 / 最大回撤 | 强调回撤控制 |
| 收益回撤比 | 同卡尔马 | 通俗表达 |
| 胜率与盈亏比 | 盈利交易占比 + 平均盈亏比 | 关注交易质量 |
| 扣除成本后净收益 | 扣手续费滑点后的收益 | 实盘导向 |
华泰 26 主要用夏普与收益回撤比。关键点:适应度计算时要模拟真实交易——按信号开平仓,扣手续费与滑点,统计盈亏,算绩效。这比选股的 IC 计算复杂得多。
关键步骤:
| 维度 | 选股挖掘 | CTA 信号挖掘 |
|---|---|---|
| 算子 | 统计量(return/std/corr) | 技术指标(均线/突破/动量) |
| 适应度 | IC/ICIR(相关性) | 夏普/回撤(回测绩效) |
| 评估复杂度 | 低(算相关) | 高(模拟交易+扣成本) |
| 样本量 | 大(每天多股) | 小(每品种一条时序) |
| 过拟合风险 | 高 | 更高(样本更少) |
| 成本敏感 | 中(换手成本) | 极高(开平仓+滑点+隔夜) |
💡 核心差异:CTA 信号挖掘的样本量远小于选股——选股每天有几千个股票样本,CTA 每个品种只有一条几十年的时序。样本少 + 噪声大,过拟合风险更严峻。这要求更严格的样本外验证与多品种稳健性检验。
华泰 26 强调的过拟合控制(比选股更严格):
优秀信号必须在一篮子品种(如 20+ 个商品期货)上都有效,而非只在某个品种上拟合。只在一个品种上有效的信号,极可能是过拟合。
把每个品种的历史分为训练期(进化)与样本外期(验证),只选样本外仍有效的信号。配合多窗口时序交叉,避免对单段历史过拟合。
信号的参数(如均线窗口 20 天)若微调就大幅改变绩效,说明过拟合。稳健信号对参数小幅变化不敏感。华泰 26 建议对关键参数做敏感性扫描,只采纳「参数邻域都有效」的信号。
CTA 对成本极敏感。回测时用保守的手续费与滑点假设(如单边 0.1%-0.2%),若扣成本后信号仍盈利,才算实盘可用。
优先保留有清晰交易逻辑的信号(如「趋势跟踪」「突破」),剔除难以解释的复杂信号——后者更可能是噪声拟合。
⚠️ 学习提示:CTA 信号挖掘的「夏普好看」极易误导——回测夏普高的信号,实盘常因成本、滑点、市场变化而大幅缩水。学本节时,把「样本外 + 多品种 + 参数敏感性 + 保守成本」当作不可妥协的底线。
华泰 26 的主要发现:
跨场景价值:遗传规划的核心思想(进化 + 公式树 + 适应度)是通用的,可迁移到选股、CTA、甚至其他领域(如因子择时、风险预警)。差异主要在算子集、适应度、评估方式的场景化设计。这种「方法论通用 + 场景化适配」的特点,使遗传规划成为因子挖掘工具箱里的多功能工具。
下一节,我们看因子挖掘的另一条线——神经网络因子挖掘,让网络(如 AlphaNet)自动学特征组合,与遗传规划的「符号运算」形成对比。