量化回测中分组条件的选择

在进行量化回测时,如果对所有股票使用同一套因子组合,不仅意义不大,还会影响策略在单个股票上的表现,毕竟不同的股票有着不同的特点,不应当强行硬套所谓“四海皆准”的策略参数。因此,对股票进行粗筛分组很有必要,但前提是筛选和分组条件应当与后续策略的选择存在因果关系,否则很容易出现样本量太小而没有统计学意义或者过拟合的问题,任何得出的结论都是自欺欺人。

基本原则

  1. 足够的样本,统计学有效性

  2. 相关的因果,分组才有意义

  3. 克制的数量,避免维度爆炸

条件因素

强因果(策略逻辑直接相关)

  • 市值:流动性溢价、机构覆盖度、策略容量都和它强相关,几乎所有策略都要先按这个分层

  • 行业/板块:不同行业驱动因子完全不同,周期股看PPI,消费看CPI,科技看估值扩张,混在一起做因子没意义

  • 波动率:高波动和低波动的最优持仓周期、仓位管理完全不同,这是风险结构差异

中等因果(有逻辑但需验证是否真的分层)

  • 估值(PB/PE):价值策略的核心分层维度,但A股低估值经常是价值陷阱,需要配合质量指标

  • 流动性(换手率/成交额):决定策略可执行性,流动性差的segment回测收益再高也无法落地

  • 趋势状态(均线方向/动量):趋势策略和均值回归策略在不同趋势环境下表现相反,分层有道理

弱因果(容易过拟合,慎用)

  • 股价绝对值:前面说了,和基本面无直接因果

  • 涨跌幅区间:比如"过去20日涨幅前30%",这类条件把因果关系倒过来了

  • 技术形态分类:太主观,难以稳定复现