因子为什么能工作——在不确定性中寻找概率优势

17 阅读 1923 字 · 约 7 分钟

量化投资的核心是因子。因子是把选股逻辑翻译成一个可计算的数字,买入因子得分高的,卖出得分低的,回测看结果。这套流程表面上是数学,但背后有个更深层的问题:因子凭什么能工作?

因子不是真理,是假设

因子有效的前提,是市场存在可以被利用的规律。但如果市场完全有效,所有信息都即时反映在价格里,任何因子都没用——你只是在给随机数排序。反过来,如果市场完全随机,规律也不存在,因子一样没用。

所以因子的用武之地不是在「有效」或「随机」两个极端,是在它们之间:市场不是完美的,但也不是完全随机的。有规律可抓,但还没被所有人抓到。

量化的本质,就是把市场看作一个概率游戏。 不是非黑即白的二元判断——这一笔不是「对」或「错」——而是每一笔交易都是期望为正的赌注,反复下注,让概率在大量重复中兑现。

但这个逻辑要成立,得先把几个埋在最底下的假设说清楚。

第一个假设:历史会重演。 不是简单重复,是某些模式会以相似的形式再出现。这个假设没法证明,但量化之所以还能做,是因为人性和制度变化慢于市场变化——恐慌时的卖出、追涨时的冲动、机构季末调仓的惯性,这些东西一百年前有,现在还有,只是换了个马甲。

第二个假设:市场定价有滞后。 信息不会瞬间反映在价格里,总有时间差。财报发布后股票的持续漂移就是最直白的证据——如果市场真的即时定价,发布当天就该一步到位,不会有后面几天的持续波动。

第三个假设:规律不会被快速套利到消失。 市场有摩擦——流动性、交易成本、容量、监管。这些摩擦保护了规律的存在。如果所有人同时用同一个因子,它确实会失效,但「同时」不成立:每个人对信息的理解不一样,反应速度不一样,风险承受能力不一样。

第四个假设:大数定律起作用。 单次结果不可预测——你再好的因子,下一笔交易可能还是亏的。但如果重复次数足够多,概率优势会体现出来。因子不在乎一次对错,在乎多次下来期望为正。

四个假设叠起来,指向同一个东西:因子不是真理,是假设。 它假设市场有规律、假设规律还没被定价、假设你能抓到它、假设大量重复后它能给你正回报。

四层矛盾,四个立足点

如果上面四个假设成立,因子就有了立足点。但它们本身是矛盾的,一个比一个反直觉。

第一,用过去解释未来,这本来就是错的,但没别的办法。

事物在发展,昨天有效的规律明天可能就失效。但这不致命——致命的是你不知道它什么时候失效。量化的目标不是找到一个「永远有效的规律」,而是在它还没失效的时候赚够,在它失效的时候认赔。

不是预测未来,是在规律还活着的时候利用它。你手里只有历史数据,不用它,你就没东西用了。

第二,市场有效与否,不是 0 还是 1,是程度的差异。

有效市场假说不是开关,是连续谱。市场不是「有效」或「无效」,是在某个尺度上有效,在另一个尺度上无效。日级别的动量可能有效——因为情绪和趋势,分钟级别的套利可能已经被做市商吃干抹净。大盘股定价效率高,小盘股信息覆盖弱。

因子不是去论证「市场无效」,是去找那个效率最低的层面——信息覆盖差的、流动性弱的、关注度低的。在这个层面上,规律还没被完全定价。

第三,因子必须有故事,不是因为它需要好看,而是没有解释的因子你不知道它在拟合什么。

回测能找到任何规律——价格做傅里叶变换都能拟合出周期。但这些是噪音,再过几个月就没了。故事的作用是给你一个独立于数据的理由,让你在样本外也敢赌。

低市盈率因子背后的故事是「便宜的东西被低估了」;动量因子背后的故事是「趋势一旦形成就有一段时间的持续」。这些故事不复杂,但它们防的不是因子失效,是过拟合:你先说清楚了为什么这个东西应该有效,才去看数据验证。反过来就是先看数据再编故事——拟合的是噪音,不是规律。

第四,规律从大样本出来,这恰恰是它的意思。

样本内成立的规律样本外可能不成立,这没错。但没有大样本验证过的规律,连样本内都不成立。回测是门槛,不是保证——它在替你淘汰最差的想法,不是替你找到最好的想法。

量化的态度不是「规律在样本内成立所以它一定有效」,是「规律在样本内都不成立别拿出来了」。你用足够多的、逻辑独立的、被验证过的因子交叉验证,让总体的期望为正。

结论:不是确定性,是概率优势

这四层矛盾的结论很简单:因子不是用来找确定性的,是用来找概率优势的。

单因子层面,你赌的不是「这个因子一定有效」,是「它在统计上比随机选股好那么一点点」。IC 不用 0.3,0.05 以上、稳定、能解释,就是可用的东西。多因子层面,你把不同逻辑的因子放在一起——动量基于行为,价值基于估值,质量基于财务——它们失效的原因不一样,一个的失效不会拖垮另一个。

这就是量化最底层的心态:承认自己不知道哪个因子会有效,但用足够多的、逻辑独立的、被验证过的因子,让总体期望为正。 不是追求确定性,是追求概率优势。