968 字
5 分钟

第 8 章:回测过拟合的检测器

全书压轴,也是与你的日常研究离得最近的一章。作者的判断没变过:回测过拟合是金融学最重要的未解问题。这一章把”多测几次就能测出圣杯”从一句警告变成一组可以计算的量。

先分工:这一页和 AFML 精读第 6 页怎么读#

书屋 AFML 精读第 6 页已经讲了缩水夏普(DSR)和 PBO 的用法与直觉;本书第 8 章是这套工具的推导现场和统计学地基——讲清楚”为什么试验次数必须进折算公式”。两页配合读:那页学操作,这页学原理。动手入口在量化学堂防过拟合一课。

地基一:多重检验与家族错误率#

单次检验的假阳性率 α = 5% 听起来很安全,但你不是只测一次。测 N 次、只要有一次假阳性就会被你当成”发现”,这个概率叫家族错误率(FWER):

FWER = 1 − (1−α)^N (检验相互独立时)

α = 5%、N = 20 时 FWER ≈ 64%;N = 100 时 ≈ 99.4%。Šidák 校正反过来解出单次检验该用多严的门槛:α_单次 = 1 − (1−α)^(1/N)。N = 100 时约 0.05%——比你惯用的 5% 严了一百倍。这就是”t 值要 3 起步”(《因子投资》)背后的算术。

地基二:假策略定理#

FWER 讲的是”至少一次假阳性”的概率,假策略定理更进一步,直接给出假发现的期望大小:对 N 个真实夏普为零的随机策略,其中最大回测夏普的期望值约随 √(2 ln N) 增长(再乘以夏普估计的标准差)。

数字感受:纯噪声、试 1000 次,最优者的期望回测夏普轻松过 2。这个定理宣判了一切”只报最好那次”的研究方式死刑——最大夏普的期望值本身就是试验次数的函数,不报 N 的夏普没有意义。

检测器:缩水夏普比率(DSR)#

把上面两块地基组装成可用的检验:

  1. 用假策略定理,从试验次数 N 和各次试验夏普的方差算出”纯靠运气应得的最大夏普”——这是你的及格线,而不是零;
  2. 检验观察到的最优夏普是否显著超过这条及格线,并用收益的偏度和峰度修正夏普估计量的分布(厚尾会拉大估计误差);
  3. 输出一个概率:校正了多重检验和非正态之后,这个策略仍有真实技能的把握有多大

注意 DSR 的输入清单里有一项是多数人给不出的:N。没记录过自己试了多少次的研究者,连自证清白的资格都没有——试验账本因此不是美德,是审计的前提。

作者的行业控诉#

本章附带一段激烈的批评:绝大多数发表的回测研究不报试验次数、不做多重检验校正,因此绝大多数发表的”发现”大概率是假的。作者甚至主张期刊应当强制披露 N。你无法改变行业,但可以改变自己:AlphaForge 的每一次 factor analyzebacktest run 都该进你的试验账本——参数、结果、弃用原因。

本页带走的三句话#

  1. 测 100 次、每次 5% 假阳率,家族错误率 99%——Šidák 告诉你单次门槛该收紧到千分之一量级;
  2. 假策略定理:纯噪声下最大回测夏普的期望随 √(2 ln N) 增长——不附带试验次数的夏普没有意义;
  3. DSR 把及格线从零抬高到”运气应得的夏普”:记不出 N 的研究,连接受审计的资格都没有。