982 字
5 分钟

第 2 章:去噪与去调——先给协方差矩阵洗澡

协方差矩阵是量化研究的地基:组合优化、风险模型、聚类全靠它。这一章的判词是:直接用样本估出来的协方差矩阵,大部分内容是噪声——好消息是,噪声的形状是可以精确算出来的。

问题:样本协方差为什么不可信#

估计 N 只股票的协方差矩阵需要 N(N+1)/2 个参数。A 股 5000 只票、十年日线约 2400 天——参数个数远超有效观测,估计误差必然巨大。更糟的是,后续使用者(组合优化器)恰恰对误差最敏感(见第 5 页”马科维茨的诅咒”)。

传统答案是收缩(如 Ledoit–Wolf):把样本矩阵往单位阵方向拉。作者的批评:收缩不分青红皂白,把信号和噪声一起削弱了。能不能只削噪声、留下信号?

Marcenko–Pastur:噪声长什么样,数学早就知道#

随机矩阵理论给出一个漂亮结论:如果收益是纯随机的(无任何相关结构),其相关矩阵的特征值不会乱跑,而是收敛到 Marcenko–Pastur 分布,全部落在一个可计算的区间内:

λ± = σ² × (1 ± √(N/T))² N=品种数, T=观测数

这就是”噪声带”。把真实数据的相关矩阵做特征分解,特征值分布通常长这样:

  • 绝大多数特征值挤在噪声带内——它们携带的”结构”与纯随机无异;
  • 少数几个特征值远超 λ₊——这才是真实信号(市场因子、行业因子);
  • 用 MP 分布对特征值直方图做拟合,就能定出信号与噪声的分界线,不需要任何主观阈值

去噪(denoising):常数残差特征值法#

分界线定了之后,处方很克制:

  1. 噪声带内的特征值,全部替换为它们的平均值(保持迹不变);
  2. 信号特征值原样保留,一分不动;
  3. 用修正后的特征值重构矩阵,再标准化回相关矩阵。

对比收缩法:收缩把所有特征值往中间拉(信号也被拉小),去噪只熨平噪声部分——作者用蒙特卡洛实验展示,去噪后的矩阵用于组合优化,样本外误差显著更小

去调(detoning):把市场那根轴抽掉#

金融相关矩阵的第一特征向量几乎总是”市场”:所有票同涨同跌的那个方向。它太强了,以至于:

  • 做聚类时,所有股票都因为”同属市场”而显得彼此相似,行业与风格结构被市场成分淹没
  • 处方:把第一(或前几个)市场特征向量从矩阵中移除后重构,这叫去调。

注意副作用:去调后的矩阵不满秩,不能直接用于均值-方差优化,但用于聚类(第 3 页)正合适——先抽掉共同噪音,分组才分得出真实结构。

对应到本平台#

factor_value 表里存了多个因子的历史值,你迟早会算”因子收益相关矩阵”来判断因子是否冗余。这一章的提醒:几个因子、几百个交易日的相关矩阵,N/T 不小,噪声带不窄——两个因子相关系数 0.3,很可能落在纯随机也能达到的范围里。先想想噪声带,再下”这两个因子不相关”的结论。

本页带走的三句话#

  1. 样本协方差矩阵的大部分特征值落在 Marcenko–Pastur 噪声带内——它们与纯随机数据无异;
  2. 去噪只熨平噪声特征值、原样保留信号,比”信号噪声一起削”的收缩法更聪明;
  3. 聚类前先去调:抽掉市场共同成分,真实的行业与风格结构才会浮出水面。