715 字
4 分钟
第二部分:样本权重与唯一性 —— 你没有那么多证据
金融 ML 翻车的隐形根源:样本之间高度重叠,而所有标准 ML 工具都假设样本独立。这一页的思想同样适用于你的 IC 分析。
问题:重叠的样本被当成独立证据
用 20 日收益打标签时,相邻两天的样本共享 19 天的信息——样本间高度相关,却被 ML 当成独立样本。后果链条:
- 等效样本量被严重高估(看似 2000 个样本,独立信息可能只相当于 100 个);
- 模型对自己的估计自信过头(标准误被低估);
- 交叉验证分数虚高(相似样本同时出现在训练集和测试集);
- 上线后”意外”翻车——其实在数据里早已注定。
处方一:唯一性加权
计算每个样本的”唯一性”(uniqueness):它的标签窗口与多少个其他样本重叠、重叠多深。然后:
- 训练时按唯一性加权:高度重叠的样本贡献打折;
- 采样时按唯一性抽样(bagging 的修正版):让每棵树看到的样本更接近独立;
- 顺带修正 bootstrap:金融样本上标准 bootstrap 会反复抽到”同一段行情的化身”,分布估计失真。
处方二:分数差分(Fractional Differentiation)
另一个正视数据性质的设计。困境:价格序列非平稳(不能直接建模),但取一阶差分(收益率)又会抹掉几乎全部记忆(长期均值回复、趋势结构都在差分中丢失)。
作者的方案:分数阶差分——差分阶数不必是 0 或 1,可以是 0.4。找到”刚好达到平稳”的最小阶数,保留最多的记忆,付出最少的平稳性代价。思想再次比技术重要:平稳性和记忆是一对权衡,行业默认的”用收益率”是把这个旋钮焊死在了 1。
对低频研究者的直接迁移
就算不做 ML,本页思想直接适用于因子分析:
- 你的回测有 2000 个交易日 ≠ 有 2000 个独立证据——《主动组合管理》里 BR 要”独立”才算数,同一个坑的 ML 版;
- period=20 的因子,相邻两期 IC 共享 19 天信息:IC 序列的 t 值按 √(样本数/period) 的量级心里打折,才是有效证据量;
- 相关性高的一篮子因子也是”重叠样本”:十个反转变体不等于十份证据。
本页带走的三句话
- 重叠样本被当独立证据,是模型自信过头的数学根源;
- 平稳性与记忆是权衡旋钮(分数差分),不是非 0 即 1 的开关;
- 回测天数 ≠ 独立证据数:IC 的 t 值按重叠程度打折后再下结论。