883 字
4 分钟

第二部分(下):从时间序列到梯度提升(第 9~13 章)

骨架搭好后,原书用五章把经典模型逐个过一遍。第 12 章梯度提升是全书模型章里实用性最高的一章——如果只允许给平台加一个 ML 模型,答案就在这章。

第 9 章:时间序列模型(选读)#

ARIMA 预测收益、GARCH 预测波动,结论与书屋其他书共振:收益难预测、波动可预测。这章真正的实战部分是协整与配对交易——用统计检验找出长期绑在一起的股票对,价差偏离时做多低估、做空高估。A 股做空受限,配对交易落地打折,但”协整 ≠ 相关”这个区分值得永久收藏:相关看同涨同跌,协整看价差是否回归。

第 10 章:贝叶斯 ML(开眼界章)#

用 PyMC3 做贝叶斯推断:动态夏普比率(夏普不是一个数,是一个随时间演化的分布)、贝叶斯版配对交易。贝叶斯框架的好处是诚实表达不确定性——回测夏普 1.2 的策略,后验分布可能告诉你”有 30% 概率真实夏普为负”。多数读者当开眼界章即可,但这个思维方式会改变你看一切回测数字的眼神。

第 11 章:随机森林(选读)#

决策树 → bagging → 随机森林的推导,案例是日本股票多空策略。随机森林是很好的教学模型(好懂、不易烂),但在表格数据竞技场上它几乎总被梯度提升压一头——读懂原理,实战直接跳第 12 章。

第 12 章:梯度提升——表格数据之王(必精读)#

XGBoost / LightGBM / CatBoost 三大件的原理与调参实战:

  • 为什么它是首选:中等样本量的表格数据(正是日频截面因子数据的形态)上,梯度提升的表现几乎总是最好或并列最好,且训练快、对特征缩放不敏感、天然处理缺失值;
  • 防过拟合三板斧:早停(early stopping)、限制树深、学习率衰减——每一样都是在跟金融数据的低信噪比搏斗;
  • SHAP 值解释预测:告诉你模型靠哪些因子赚钱——能解释的模型才敢上钱,SHAP 是 ML 因子从黑箱走向可审计的桥;
  • 书中用它做日内和日频信号,完整走通”因子做特征 → 预测收益排名 → 回测”的闭环。

给平台的路线图:把 factor_value 表里的多个因子当特征、前向收益当标签,LightGBM 训练 + 时间序列拆分验证 + SHAP 检查——这就是平台 ML 因子的 1.0 版本。

第 13 章:无监督学习(选读)#

PCA 从收益率矩阵里提取数据驱动的风险因子(第一主成分 ≈ 市场因子)、特征组合(eigen portfolios)、聚类用于资产配置(为 HRP 铺路)。无监督的角色是理解结构而非直接预测——用 PCA 看看你的一篮子因子是不是其实在重复同一个故事,是它对平台最实际的用法。

本页带走的三句话#

  1. 表格因子数据上模型选择的默认答案是梯度提升:LightGBM + 早停 + 时间序列拆分;
  2. SHAP 让 ML 因子可审计——能解释的模型才敢上钱;
  3. 协整不是相关,贝叶斯后验教你对每个回测夏普保持体面的怀疑。