1023 字
5 分钟

收益率的统计事实:正态与独立的双重出局

对应原书第 1 章”金融时间序列及其特征”。全书最重要的一章:先用数据把”收益率是什么样”看清楚,再谈用什么模型——顺序不能反。

先把口径定准:简单收益率与对数收益率#

  • 简单收益率 R = P_t / P_{t-1} − 1:资产间横截面可加(组合收益是成分的加权平均),因子研究、组合回测用它;
  • 对数收益率 r = ln(P_t / P_{t-1}):时间上可加(20 天对数收益 = 逐日相加),统计建模、多期分析用它。

日频下两者差异极小,但长周期或大波动时不可混用——单日 ±10%(A 股涨跌停幅)时差异已到 0.5 个百分点。平台的回测引擎按简单收益率口径逐日结算,与此处约定一致。

事实一:尖峰厚尾#

把日收益率标准化后与标准正态比,经验分布总是峰更尖、尾更厚

  • 正态分布峰度为 3,股票日收益率的样本峰度普遍在 5~30 之间,超额峰度显著为正;
  • 正态世界里 |z|>4 的日子约每 63 年一遇,真实市场每几年就来一次;
  • Jarque–Bera 检验(联合检验偏度 = 0 且超额峰度 = 0)在几乎任何金融日收益序列上都以极小的 p 值拒绝正态。

后果很实际:用标准差当风险刻度(夏普比率、均值方差优化、参数法 VaR)会系统性低估极端风险。这正是《市场的(错误)行为》全书的控诉,蔡瑞胸用检验统计量把它变成了每个人可以在自己数据上复算的例行程序。

事实二:收益近乎独立,波动高度相关#

对收益率序列算自相关(ACF),再对其绝对值、平方序列算自相关,会看到全书最深刻的一张对比图:

  • 收益率本身:自相关微弱,通常前几阶就掉进置信带内——线性可预测性极低;
  • 收益率的绝对值 / 平方(波动的代理):自相关显著为正,且衰减极慢,几十个交易日后仍在带外。

这就是波动聚集(volatility clustering):大波动跟着大波动,平静跟着平静。市场对收益的方向近乎失忆,对波动的量级却记性很好。曼德博叫它”约瑟效应”(丰年灾年成串),蔡瑞胸给它配上了可估计的模型(第 4 页 GARCH)。

用 Ljung–Box 统计量可以把”看图”变成检验:对收益率做 Q 检验常常无法拒绝白噪声,对平方收益率做则强烈拒绝——独立性假设的出局证据,比正态出局的证据还要干净。

对量化研究者的三点意义#

  1. 一切显著性都要打折:t 值、IC 的置信区间默认了独立同分布;厚尾 + 波动聚集意味着有效样本比表面天数少,显著性比表面水平虚——这与《金融机器学习》的样本权重章节遥相呼应;
  2. 风险预算看尾部,不看标准差:回测报告里最大回撤、单日极端亏损比波动率更接近真实风险;
  3. A 股同样适用且更极端:涨跌停制度把单日尾部截断,却把风险挤进连续跌停与流动性枯竭——分布形状变了,厚尾本质没变。第 6 页的动手练习会让你在平台数据上亲手复算这两个事实。

本页带走的三句话#

  1. 收益率的两大统计事实:尖峰厚尾(正态出局)、波动聚集(独立出局)——全书所有模型都是对这两条的回应;
  2. 收益率本身近乎白噪声,绝对值却有长记忆:市场忘记方向,记住恐惧;
  3. 从此看到任何基于正态与独立假设的指标(夏普、参数 VaR、t 值),先在心里补一行小字:分布假设待验。