1028 字
5 分钟

第二部分:统计基础 —— 读懂 IC 报告的地基

原书统计部分从描述统计讲到回归。本页按”量化研究实际用到什么”重排,目标只有一个:让你真正读懂因子分析报告里每个数字的统计学含义,而不是背阈值。

描述统计:均值、标准差和它们的除法#

  • 均值:平均水平。IC 均值、平均收益都是它;
  • 标准差:波动大小。年化波动、IC 标准差都是它;
  • 它们的除法是量化最爱:夏普比率 = 均值/标准差(收益口径)、ICIR = 均值/标准差(IC 口径)——同一个思想:“平均赚多少”必须除以”赚得稳不稳”才有意义

另外两个值得认识的形状指标:偏度(收益分布对称吗?负偏 = 偶尔大亏)和峰度(极端值多吗?金融收益普遍”尖峰厚尾”——比正态分布更常出黑天鹅)。它们提醒你:只看均值和标准差,会低估极端风险。

分布与中心极限定理:为什么 t 检验能用#

单日收益不服从正态分布(厚尾),但大量样本的均值近似正态(中心极限定理)——这就是为什么我们能对”IC 的均值”做 t 检验,哪怕 IC 本身分布不规则。

代价是:样本量必须够。这直接解释了第四课的提醒”样本期数几十期以下结论不可靠”——中心极限定理还没生效,检验就没有地基。

假设检验:t 值到底在说什么#

流程永远是同一套:

  1. 原假设 H0:“因子无效”(IC 均值 = 0);
  2. 算 t 统计量:t ≈ 均值 ÷ (标准差/√n)——均值离 0 越远、波动越小、样本越多,t 越大;
  3. 判断:|t| > 2 时,“如果因子真的无效,出现这种数据的概率不到 5%”→ 拒绝原假设。

三个最容易误解的地方:

  • t 值大 ≠ 效果大:t 里有个 √n,样本够多时微弱的效果也能”显著”。显著性(是不是真的)和重要性(值不值得做)是两个问题——IC 均值 0.005 哪怕 t=3 也太弱,不值得做;
  • p<0.05 不是”95% 概率有效”:它说的是”无效的前提下数据这么极端的概率<5%“——方向完全不同;
  • 反复检验会摧毁显著性:试 100 个因子总有几个过线(《因子投资》精读第 5 页的多重检验问题,统计学根源在这里)。

相关与回归:IC 和 Beta 的出身#

  • Pearson 相关系数:两列数的线性相关,[-1,1]——IC 就是它(因子值 vs 下期收益);
  • Spearman 秩相关:先换成排名再算相关——RankIC 就是它,对极端值免疫(A 股一字板多,所以实务以 RankIC 为主);
  • 一元回归:y = α + βx + ε。系数 β 和相关系数是近亲(β = 相关系数 × 波动比);CAPM 的 Beta 就是股票收益对市场收益回归的 β
  • 相关 ≠ 因果:回归再显著也只说明”同动”,不说明”谁导致谁”——这就是为什么因子必须先有经济逻辑(谁送钱、为什么送)。

对应本平台#

第四课那张 IC 报告表,现在可以用统计语言完整重读:IC 均值(效应大小)、IC 标准差(效应波动)、ICIR(信噪比)、t 值(显著性)、IC>0 占比(稳定性的朴素度量)、样本期数 n(检验的地基)。每个指标都是本页某个概念的直接应用。

动手:在因子分析页跑同一个因子,limit=150 和 limit 留空各一次,观察 t 值变化——亲眼看到”样本量进入 t 统计量”是什么效果。

本页带走的三句话#

  1. 夏普和 ICIR 是同一个思想:均值必须除以波动才有意义;
  2. t 值大不等于效果大——显著性和重要性是两个独立的问题;
  3. IC 是 Pearson 相关,RankIC 是 Spearman 秩相关,后者对 A 股的极端值更稳健。