1014 字
5 分钟

第 2 章(下):方法论之多重检验与因子动物园

这一页是全书最有”当代性”的内容:为什么学术界发表了 400 多个”显著”因子,而其中大量是假的?读懂这一页,你对一切”回测显著”都会多一层免疫力。

因子动物园(Factor Zoo)#

Cochrane(2011)创造的词:几十年来学术界发表的”显著因子”多达数百个,像动物园一样品种繁多。问题是——市场哪来这么多独立的收益来源?

Harvey, Liu & Zhu(2016)系统清点了 300 多个已发表因子后给出结论:按传统 t>2 的标准,相当比例的已发表因子是统计幻觉。原因就是多重检验。

多重检验:显著性是怎么被”用坏”的#

单次假设检验里,t>2(p<0.05)意味着”如果因子无效,只有 5% 的概率看到这么强的结果”。这个 5% 是为单次检验设计的

但现实是:全世界的研究者在同一段历史数据上,检验了成千上万个候选因子。哪怕所有因子全是噪声,纯靠运气每 100 个也有约 5 个过线。而学术发表和策略上线都有筛选偏差——只有过线的被看见,没过线的被丢弃。于是”被看见的显著结果”里,假货比例远高于 5%。

这不是舞弊,是流程的结构性缺陷:显著性会被尝试次数消耗掉,而尝试次数往往不可见(你看不到别人悄悄试了多少个)。

学术界的应对#

  • 提高门槛:Harvey 等人主张新因子的 t 值门槛从 2 提到 3(对应 p≈0.003);
  • 多重检验校正:Bonferroni、Holm、FDR(错误发现率)等方法,按尝试次数折算显著性——原书对这些方法有相当篇幅的介绍,思想都是”试得越多,单个结果要求越严”;
  • 样本外与可复制性检验:McLean & Pontiff(2016)的著名发现——因子在论文发表后,溢价平均衰减过半。一半可能是套利资金涌入(真因子被赚平),一半可能本来就是数据窥探(假因子现出原形)。

对个人研究者的操作指引#

你一个人也是一个”微型因子动物园”——在本平台试 20 个因子挑最好的,和学术界的问题一模一样。自保守则:

  1. 记账:老老实实记录试过多少个因子(包括失败的),评价最好结果时心里按尝试次数打折;
  2. 提门槛:筛选出来的因子,要求 |t| > 3 而不是 2;
  3. 先逻辑后数据:有经济逻辑的因子,先验概率高,同样的 t 值可信度更高——这是贝叶斯直觉:对”离奇的发现”要求更强的证据;
  4. 留样本外:调参只用一段历史,最终检验用藏起来的另一段——样本外翻车立即放弃;
  5. 警惕完美:结果好得反常(|IC|>0.1、IR 轻松破 1),第一假设是流程有错而不是发现了圣杯。

对应本平台#

  • 「因子对比」页一次评估 13 个因子——这本身就是 13 重检验,看排名第一的因子时请记得打折;
  • 第四课的提醒”一口气试了几十个因子,单个 t>2 也可能只是运气”、第六课的”诚实记录”,就是本页思想的操作化。

动手:在因子对比页跑一次全因子对比,数一数 |t|>2 的有几个、|t|>3 的还剩几个——后者才是你该认真对待的名单。

本页带走的三句话#

  1. 显著性会被尝试次数消耗——你看到的”t>2”背后可能有 100 次没被看到的尝试;
  2. 新因子按 t>3 的标准要求自己,有经济逻辑的可以适当放宽;
  3. 因子发表(或你自己”发现”)之后衰减是常态——持续监控比一次检验重要。