985 字
5 分钟
第 2 章:收缩与正则化,其实是贝叶斯先验
全书的技术地基。这一章表面在复习监督学习,实际在完成一次翻译:把 ridge、lasso 这些”工程技巧”翻译成贝叶斯语言——你以为你在调参,其实你在表达信念。
高维回归的困境
因子研究的本质是回归:用一堆特征(估值、动量、质量……)预测未来收益。问题在于候选特征几百上千个,而有效样本没多少——普通最小二乘(OLS)在这种”特征多、样本少、噪声大”的环境里会疯狂拟合噪声,样本内 R² 很漂亮,样本外一塌糊涂。
标准解药是正则化:在损失函数里加惩罚项,逼系数往零收缩。
- Ridge(L2):惩罚系数平方和,所有系数按比例缩小,谁也不清零;
- Lasso(L1):惩罚系数绝对值和,把不够强的系数直接压成零,做出稀疏解。
本章的关键翻译:惩罚项 = 先验信念
这是全书最重要的一步。Nagel 反复强调一个贝叶斯事实:
- Ridge 回归的解,数学上完全等价于贝叶斯回归的后验均值——假设你事先相信”系数服从均值为零的正态分布”;
- Lasso 等价于换一个先验——“系数服从尖峰厚尾的拉普拉斯分布”(大多数特征没用,少数有用);
- 惩罚力度 λ 越大 = 先验越”顽固”= 你越相信”这些特征其实没有预测力”。
一句话:收缩不是数值技巧,是信念表达。选择 ridge 还是 lasso,等于回答”我相信预测力是分散在众多特征上,还是集中在少数特征上”——这是个经济学问题,不是调参问题。
为什么这个翻译在金融里生死攸关
在图像识别里,先验选得糙没关系——数据多到可以淹没先验。金融相反:数据少、噪声大,先验对结果的影响巨大,因此”随便选个正则化方式,让交叉验证去定 λ”是把最重要的建模决策交给了噪声。
Nagel 给出的判断标准:既然先验必然强烈影响结论,那就应该把先验摆到台面上,用经济学推理为它辩护——下一章就是做这件事。
顺带的地图:树模型与神经网络
本章后半快速过了一遍回归树、随机森林、梯度提升和神经网络。Nagel 的态度冷静:这些方法擅长捕捉非线性和交互作用,但同样需要正则化,而它们的正则化(树深、剪枝、dropout)更难给出经济学解释——灵活性是借来的,利息是可解释性。书中后续章节的主角仍是带收缩的线性方法,这个选择本身就是立场。
对照 AFML 与本平台
- AFML 教你”时间序列交叉验证要 purge + embargo”——那是保证 λ 估得不被泄漏污染;Nagel 问的是更前一步的问题:λ 到底该不该全权交给交叉验证?
- 在本平台做因子加权组合(比如把多个因子的 IC 加权合成)时,你已经在隐式做收缩了——等权合成 = 强先验”每个因子同等重要”。意识到这一点,是读懂下一章的门票。
本页带走的三句话
- Ridge 等价于正态先验、lasso 等价于拉普拉斯先验:选正则化方式 = 回答”预测力是分散的还是稀疏的”;
- 数据多的领域先验无所谓,金融数据少噪声大,先验强烈影响结论——所以必须把它摆上台面用经济学辩护;
- 树和神经网络的灵活性是借来的,利息是”正则化没有经济学解释”。