846 字
4 分钟
第 7~8 章:PCA 因子、随机矩阵与超额收益的评估
第 7 章是全书数学的最高峰:让数据自己说出因子是什么,但要先学会分辨”数据说的”和”噪声说的”。第 8 章回到老问题——alpha 怎么评估。(原创笔记,非译文)
统计因子模型:PCA 路线
与基本面模型相反,统计因子模型不预设任何特征:对收益协方差矩阵做特征分解,方差最大的前 K 个主成分方向就是因子。好处是无需特征数据、自动适应市场结构变化(第一主成分几乎总是”市场”);代价是因子没有名字,解释和沟通困难。
随机矩阵理论:这一章的灵魂
核心问题:样本协方差的特征值系统性失真。N 只股票、T 天数据,当 N/T 不趋于零(实务常态:3000 只票、500 天),纯噪声也会产生看似显著的特征值弥散。
- Marchenko–Pastur 定律给出纯噪声特征值的理论分布:落在这个”噪声带”里的特征值不携带信息——能从噪声里探出头的大特征值才配当因子,这给了”取几个主成分”一个有原则的答案;
- 尖峰协方差模型(spiked covariance):真实结构 = 少数大特征值(尖峰)+ 噪声海洋。理论刻画了残酷事实:样本大特征值向上偏(把噪声算进了自己头上),对应特征向量与真方向有系统夹角;
- 特征值最优收缩:既然知道偏差的方向和大小,就可以解析地把每个样本特征值”缩”回去。这是收缩思想的第三次出场——从经验技巧升级为有闭式解的理论。
第 8 章:评估超额收益
因子模型就位后,回到研究者最关心的问题:一个信号到底有没有 alpha?
- 先正交化再评估:信号收益对风险因子回归,只有残差部分算数;
- IC 与信息比率的关系(G&K 的 IR = IC×√BR 在这里被更严谨地重述):宽度 BR 指的是独立下注数,相关信号的宽度要打大折扣;
- 多重检验警告与 AFML 同频:试得够多,噪声也会给你好看的回测——评估协议里必须记录尝试次数。
对本平台用户的迁移
- 用平台面板数据对相关矩阵做特征分解,画特征值谱:能亲眼看到 A 股第一主成分(市场)有多大,以及后面的特征值多快沉入噪声带;
- 挑主成分个数别再拍脑袋”取 10 个”,对照 Marchenko–Pastur 噪声带上界(细节属方法迁移,非书中原例);
- 把你最好的因子对前几个主成分回归——残差还有 IC,才是真增量。
本页带走的三句话
- N/T 不小时,纯噪声也会长出漂亮的特征值——先画出 Marchenko–Pastur 噪声带,探出头的才配当因子;
- 样本大特征值系统性向上偏,最优收缩有闭式解——第三次证明:好估计 = 承认样本量有限并主动打折;
- 评估 alpha 的铁序:先对风险因子正交化,残差才算数;宽度是独立下注数,相关信号的 √BR 要大打折扣。