894 字
4 分钟

第 4 章:因子动物园的收缩解法

本章把前两章的方法论投入实战:几百个候选特征同时进场,横截面资产定价怎么做?这是 Nagel 与 Kozak、Santosh 合作的”收缩横截面”研究的书面版,也是学界处理”因子动物园”的代表方案。

问题:动物园里没有裁判#

《因子投资》讲过因子动物园的乱象:文献里发表的”显著因子”数以百计,逐个 t 检验互相打架。传统做法是两条死路:

  • 全都要:几百个特征直接进 OLS——高维灾难,样本外崩溃;
  • 只挑五个:像 Fama-French 那样人工钦点少数因子——挑选过程本身就是一次巨大的、未登记的多重检验。

Nagel 的路线:全都要,但按经济学先验收缩。

方案:在主成分空间做收缩#

技术核心可以用三句话讲完:

  1. 把每个特征做成一个多空组合收益,得到几十上百个”特征组合”;
  2. 对这些组合的收益做主成分分解(PCA),把定价信息浓缩到少数大方差方向上;
  3. 收缩时区别对待:大特征值(高方差)主成分少收缩,小特征值主成分狠狠收缩——甚至归零。

为什么这样收缩?还是无套利先验:如果一个收益方向方差很小却有很高的期望收益,它就是一台近似套利机器——这种机会不应该大规模存在。所以”小方差方向上的高收益”大概率是噪声,先验就该狠狠地怀疑它。惩罚的形状,再一次由经济学决定。

结果与冷水#

实证结论有两面。好的一面:这样构造的 SDF(随机贴现因子)样本外确实有稳定的解释力,明显好于稀疏的少因子模型。冷水的一面更值得记住:

  • 稀疏性在特征空间不成立——找不到”真正重要的那五个因子”,定价信息弥散在大量特征的组合里;换一段样本,入选的特征名单大换血,但组合的整体表现不变;
  • 这意味着”哪个因子重要”这类问题可能根本没有稳定答案——重要的是张成的空间,不是坐标轴的名字;
  • 样本外夏普远低于样本内——即使方法论全对,收缩到位,能赚到的可预测性也很有限。天花板确实存在。

对因子研究日常的启示#

这一章对”挖新因子”的日常最直接的教训:当你发现新因子与动量、估值相关性很高时,正确的问题不是”它显著吗”,而是**“它在已有因子张成的空间之外还有增量吗”**。本平台的因子对比页做相关性检查就是这个用途的第一步——相关性高的”新”因子,多半只是老方向换了个名字。

本页带走的三句话#

  1. 面对因子动物园,人工钦点五因子和全量 OLS 都是死路——正路是全量进场、按无套利先验分层收缩;
  2. 收缩的方向感:小方差方向上的高收益 = 近似套利 = 大概率是噪声,狠狠怀疑它;
  3. 稀疏性是幻觉——定价信息弥散在特征组合里,“哪五个因子最重要”可能是个没有稳定答案的问题。