978 字
5 分钟
因子定价:从 PCA 到 IPCA 与自编码器
综述第 4 章(Risk-Return Tradeoffs)。上一章问”什么能预测收益”,这一章问更深一层的问题:这些预测力是风险补偿(beta)还是错误定价(alpha)——这是资产定价的本行。本页来自 Kelly–Xiu 免费综述(SSRN 4501707)的精读。
问题设定:APT 的现代化
Ross 的套利定价理论(APT)说:收益由少数共同因子驱动,承担因子风险才有稳定回报。传统做法是人工指定因子(Fama-French 三/五因子)。ML 时代的问题变成:能不能让数据自己说出因子是什么,以及公司特征到底是在描述风险暴露还是在标记定价错误。
无条件因子模型:让 PCA 更懂定价
- 经典路线:对收益协方差矩阵做 PCA 提取统计因子(Connor & Korajczyk 传统);
- RP-PCA(Lettau & Pelger, 2020):关键改进——普通 PCA 只看方差,会漏掉”方差不大但均值溢价高”的弱因子;在目标函数里加入对均值的惩罚项后,提取的因子定价能力显著更强;
- 高频分支(4.5 节,修大成的主场):用日内数据估计因子结构与协方差,Aït-Sahalia 与 Xiu 等人的系列工作——高频信息能显著改善协方差估计,但对预期收益帮助有限。
条件因子模型:IPCA(本章的明星方法)
IPCA(Instrumented PCA),Kelly, Pruitt & Su(JFE 2019)《Characteristics Are Covariances》:
- 核心想法:允许因子载荷(beta)随公司特征动态变化——把特征当作 beta 的”工具变量”,而不是像传统做法那样把特征直接当收益预测器;
- 这个设计让”风险还是错误定价”变成一个可检验的问题:特征通过 beta 起作用(风险补偿),还是绕过 beta 直接带来超额收益(alpha);
- 实证结论(标题即答案):特征的大部分预测力可以被”特征驱动的动态 beta”解释——Characteristics are covariances。用五个 IPCA 因子解释横截面收益,好于几十个人工因子;
- 检验发现少数特征仍带显著 alpha(如动量类),说明风险解释不是全部。
非线性延伸与”因子动物园”清理
- 条件自编码器(Gu, Kelly & Xiu, 2021):IPCA 的神经网络版——beta 是特征的非线性函数,因子仍从收益中提取。非线性带来进一步但边际递减的改善;
- 复杂因子模型(Didisheim, Ke, Kelly & Malamud《APT or “AIPT”?》):把第 2 页”复杂度的好处”搬进因子定价——用海量非线性因子近似 SDF,主张定价模型同样”越大越好”(同样伴随争议,见第 2 页);
- Alpha 检验(4.6 节):在成百上千个候选因子里判断谁真有 alpha,必须处理多重检验;ML 检验出的 alpha 通常集中在小盘、非流动性股票——统计上显著,容量上存疑。
对本平台用户的意义
你现在做的 IC 分析回答的是”特征能不能预测收益”,IPCA 追问的是”这预测力是不是只是风险暴露的报酬”。前者决定策略赚不赚钱,后者决定它为什么赚钱、以及拥挤后还能不能继续赚。做深因子研究,这一层迟早要补。
带走的三句话
- 这一章的中心问题不是”能不能预测”,而是预测力是 beta 还是 alpha——IPCA 把它变成了可检验的统计问题;
- IPCA 的答案写在标题里:特征即协方差——大部分特征溢价可以被特征驱动的动态风险暴露解释,但动量等少数 alpha 幸存;
- 深挖清单:RP-PCA(Lettau & Pelger 2020)、IPCA(Kelly, Pruitt & Su 2019)、条件自编码器(Gu, Kelly & Xiu 2021)——三篇按顺序读,就是这一章的主线。