复杂度的好处:大模型未必过拟合
综述第 2 章(The Virtues of Complex Models),全文理论上最硬、也最有争议的部分。它挑战一条几乎人人默认的直觉:参数比样本还多的模型必然过拟合。提醒:本页内容来自 Kelly–Xiu 免费综述(SSRN 4501707),且这一章大量基于作者自己的研究——请连同争议一起服用。
传统直觉,以及它为什么可能是错的
金融老兵的信条是”参数越少越稳”:样本就几百个月,你上一万个参数,等着样本外爆炸吧。但机器学习理论近年的进展(双下降,double descent)发现:当参数数量越过”恰好插值”那个危险点继续增加后,样本外误差可能重新下降——过参数化区域里,模型平均了海量弱预测器,反而变得平滑稳健。
关键机制是隐式正则化:在参数远多于样本时配合岭回归收缩(乃至”无岭极限”ridgeless regression),大模型的行为接近于对无数简单模型做贝叶斯平均,而不是死记硬背训练样本。
核心论文与结论
- Kelly, Malamud & Zhou《The Virtue of Complexity in Return Prediction》(Journal of Finance, 2024):用随机特征 + 岭回归做市场择时,理论证明并实证展示样本外 R² 和策略夏普随参数数量单调改善,即使观测只有十几个、参数上万;
- 姊妹篇《The Virtue of Complexity Everywhere》:把结论推广到国际股票、债券、商品、汇率等几乎所有资产类别;
- 理论工具来自统计学习文献:Hastie 等人关于高维无岭最小二乘的”惊奇”结果、Belkin 等人的双下降曲线。
复杂度楔子(complexity wedge)
第 2.3 节给出一个实用警告:在高复杂度区域,样本内指标与样本外表现之间的楔子会系统性变大——训练误差、经典信息准则(AIC/BIC)全部失效,唯一可信的评估是严格的样本外检验。这一点与 AFML 的回测方法论批判殊途同归:越复杂的模型,越不能相信任何”内样本”证据。
学界的争论(务必知道)
“复杂度的好处”发表后引来了一波认真的质疑,争论仍在进行:
- Buncic(2024 起的系列评论) 指出:原文的”绩效随复杂度单调上升”部分来自零截距约束和特殊的绩效聚合方式,放松这些设定后,复杂模型对朴素基准的优势大幅缩水;
- 另一类批评认为复杂模型的超额收益很大程度上是波动率择时的包装——把同样的波动率缩放施加到简单基准上,差距明显收窄;
- Kelly 与 Malamud 撰文《Understanding the Virtue of Complexity》回应,认为批评不动摇理论结果,但承认经济收益的幅度取决于实现细节。
诚实的总结是:理论层面”过参数化不必然过拟合”已经站得住(这是统计学习的共识);实证层面”上大模型就能赚更多”远没有定论。对实践者的启示是两条都别走极端:既不要用”参数多必死”直接否决大模型,也不要把单调上升的夏普曲线当成免费午餐。
对本平台用户的意义
你在 AlphaForge 上做的是低维因子研究(几个因子、线性排序),离”过参数化”很远——这一章的直接价值不是让你上一万个参数,而是:(1) 破除对”复杂 = 过拟合”的教条式恐惧;(2) 记住复杂度楔子:模型越复杂,样本内证据越不可信。
带走的三句话
- 双下降 + 隐式正则化说明”参数多于样本必然过拟合”在理论上不成立——过参数化模型可能相当于对海量弱预测器做平均;
- “复杂度的好处”的实证结论(夏普随参数单调上升)在学界有实质争议:零截距约束、绩效聚合方式、波动率择时都被指为结果的重要驱动;
- 复杂度楔子是最实用的一条:模型越复杂,样本内指标越失真,样本外检验越是唯一的裁判。