量化数据越多越好吗?精确的模糊与模糊的精确
量化投资的核心是数据加因子加策略:数据是原料,因子是加工,策略是决策。数据越多、类型越丰富,直觉上策略应该越准——信息越全,判断越准,这符合常识。
但常识不等于正确。在量化里,数据多和策略好之间,隔着一道看不见的墙。
精确的模糊 vs 模糊的精确
给一张图片不断加像素,画面越来越清晰,这是分辨率提升。给一个策略不断加数据维度——PE、PB、PS、ROE、换手率、波动率、行业分类、市值分层、大盘情绪指标——你以为也是在提升分辨率,但你不是。
数据多了,回测曲线越来越漂亮,IC 越来越高,但你是用一个越来越精细的模型去描述一个你其实没看透的市场。精度是假象,这叫精确的模糊。
反过来,知道某个方向大概率对——便宜的东西长期有回归压力、趋势一旦形成会持续一段——但说不清具体哪个时间点、哪个幅度。方向大致可控,这叫模糊的精确。
二者之间的选择,不是「数据多好还是少好」,是你得先知道自己要什么:想要精确就接受模糊,想要模糊才能找到精确。
数据只是市场的简化抽象
数据不是市场的全部,也不可能是。它只是我们为了理解市场而做的一个简化投影——就像地图不是地形本身,只是把三维世界压成二维的几条线。这层抽象本身没有错,但要紧的是:它省略了什么。
能被量化的东西本来就有限。财报、行情、成交量——这些都只是市场的一小部分投影。真正影响股价的东西,比如政策突然转向、机构内部风控砍仓、行业内幕、某个人物的一句话——这些要么没数据,要么数据到你手里时早就晚了。
你在越来越精确地描述一个不完整的画面。精度高了,但缺的东西还是缺。
第二,每加一个维度,加的不只是信号,还有维度本身的噪声。 财务数据有财报粉饰,行情数据有做市商干扰,另类数据有爬虫偏差。你以为 PE 偏了一点、换手率偏了一点、行业分类偏了一点——各偏各的——但合在一起,偏得不算少。误差不是加法,是乘法。
第三,市场本身是多主体博弈,不是单一优化方程。 机构、散户、游资、做市商,各玩各的逻辑。你加再多数据也拟合不了所有人的行为规则,因为规则本身在变。今天的动量因子有效,是因为散户在追涨;下个月的动量失效,是因为机构在反向做。数据告诉你过去发生了什么,但不告诉你谁会来、什么时候来、用什么逻辑来。
那为什么还要用数据
因为不用数据做决策的唯一替代方案是靠直觉。直觉更不可靠——它连「大概」都没有,只有「我觉得」。
数据差,但它是唯一能把你从「我觉得」「我听说」「我感觉」里拉出来的东西。你放弃数据,不是回到更清醒的状态,是回到更糊涂的状态。
数据和直觉的区别不在准确度,在可证伪。直觉对的时候你不会知道为什么对,错的时候你也不会知道为什么错,没法学。数据错了你能回测看到错在哪里,能改。
不用很多数据,和不用任何数据,是两回事。有几类核心数据——价格、估值、成交量——就能做基础的决策了。不放太多是怕噪声,不用这些是不留锚点。
个人量化该守的边界
个人做量化,不要跟机构比数据、比速度。避其锐气,不跟它在同一个赛道上。不做日内、不做它们盯着的票——这些前面文章已经讲过,不展开。
数据策略上同样要避其锐气。
守住几类核心数据。 价格、估值、成交量——这三类数据的噪声你知道在哪:价格是交易出来的不是定价出来的,估值有财报粉饰,成交量有对倒。知道它们的坑在哪里,就比加十种不熟的数据强。少而懂的维度,胜过广而浅的维度。
追求可解释,不追求高 IC。 一个因子你说得清它为什么应该有效,IC 低一点也能用。一个因子你解释不了,IC 再高也怕样本外就没了。可解释是防过拟合的最后一道墙——不是防数据,是防你自己。
追求可执行,不追求全覆盖。 不在所有维度上追平机构,在你选的维度上把策略做到能执行。机构要验证 200 个因子,每个因子都要解释;你只用 5 个,每个都清楚它什么时候大概会失效。不是能力弱,是打法不同。
数据多了未必更清醒。知道什么不要加,比知道什么能加更值钱。
寒蝉 Hancic

