894 字
4 分钟
第 4 章:因子动物园的收缩解法
本章把前两章的方法论投入实战:几百个候选特征同时进场,横截面资产定价怎么做?这是 Nagel 与 Kozak、Santosh 合作的”收缩横截面”研究的书面版,也是学界处理”因子动物园”的代表方案。
问题:动物园里没有裁判
《因子投资》讲过因子动物园的乱象:文献里发表的”显著因子”数以百计,逐个 t 检验互相打架。传统做法是两条死路:
- 全都要:几百个特征直接进 OLS——高维灾难,样本外崩溃;
- 只挑五个:像 Fama-French 那样人工钦点少数因子——挑选过程本身就是一次巨大的、未登记的多重检验。
Nagel 的路线:全都要,但按经济学先验收缩。
方案:在主成分空间做收缩
技术核心可以用三句话讲完:
- 把每个特征做成一个多空组合收益,得到几十上百个”特征组合”;
- 对这些组合的收益做主成分分解(PCA),把定价信息浓缩到少数大方差方向上;
- 收缩时区别对待:大特征值(高方差)主成分少收缩,小特征值主成分狠狠收缩——甚至归零。
为什么这样收缩?还是无套利先验:如果一个收益方向方差很小却有很高的期望收益,它就是一台近似套利机器——这种机会不应该大规模存在。所以”小方差方向上的高收益”大概率是噪声,先验就该狠狠地怀疑它。惩罚的形状,再一次由经济学决定。
结果与冷水
实证结论有两面。好的一面:这样构造的 SDF(随机贴现因子)样本外确实有稳定的解释力,明显好于稀疏的少因子模型。冷水的一面更值得记住:
- 稀疏性在特征空间不成立——找不到”真正重要的那五个因子”,定价信息弥散在大量特征的组合里;换一段样本,入选的特征名单大换血,但组合的整体表现不变;
- 这意味着”哪个因子重要”这类问题可能根本没有稳定答案——重要的是张成的空间,不是坐标轴的名字;
- 样本外夏普远低于样本内——即使方法论全对,收缩到位,能赚到的可预测性也很有限。天花板确实存在。
对因子研究日常的启示
这一章对”挖新因子”的日常最直接的教训:当你发现新因子与动量、估值相关性很高时,正确的问题不是”它显著吗”,而是**“它在已有因子张成的空间之外还有增量吗”**。本平台的因子对比页做相关性检查就是这个用途的第一步——相关性高的”新”因子,多半只是老方向换了个名字。
本页带走的三句话
- 面对因子动物园,人工钦点五因子和全量 OLS 都是死路——正路是全量进场、按无套利先验分层收缩;
- 收缩的方向感:小方差方向上的高收益 = 近似套利 = 大概率是噪声,狠狠怀疑它;
- 稀疏性是幻觉——定价信息弥散在特征组合里,“哪五个因子最重要”可能是个没有稳定答案的问题。