892 字
4 分钟

第二部分(上):ML 工作流的骨架(第 6~8 章)

原书第二部分共八章(6~13),是全书篇幅最大的板块。本页先讲骨架三章:ML 流程(第 6 章)、线性模型(第 7 章)、从模型到回测的 ML4T 工作流(第 8 章)。这三章是”给平台加 ML 因子”绕不开的地基,建议精读。

第 6 章:机器学习流程(金融特供版)#

标准内容(监督/无监督、偏差-方差权衡、sklearn Pipeline)任何 ML 书都有,这章的金融特供价值在交叉验证

  • 金融数据禁止随机打乱:样本有时间顺序,随机 K 折会让模型”用未来验证过去”,分数虚高——必须用时间序列拆分(训练集永远早于验证集);
  • 泄漏无处不在:特征里混进未来信息(用当天收盘价算的因子去预测当天收益)、标准化时用全样本均值——每一种都能造出回测神话;
  • 更严格的 Purged K-Fold(清除重叠样本)在《金融机器学习》里展开,两本书在这里握手。

对照平台:research/dataset.py 计算前向收益时因子值与收益错开一天,就是在源头掐断泄漏——读这章你会明白那行代码为什么神圣。

第 7 章:线性模型——所有炫模型的及格线#

从因子模型传统讲到收益预测:OLS 的假设与诊断、岭回归/Lasso 正则化、逻辑回归做涨跌方向分类,以及学术界标配的 Fama-MacBeth 回归(先截面后时序,估计因子风险溢价)。

这章最重要的不是技术,是态度:线性模型是基准。信噪比这么低的数据上,非线性模型的花哨容量大多用来拟合噪声——任何深度模型上场前,先让它跑赢岭回归,跑不赢就别浪费算力。这也是给平台加模型层的推荐路径:第一版就用线性回归把多个因子合成一个打分,能跑通、能解释、不易过拟合。

第 8 章:ML4T 工作流——从模型到策略回测(必精读)#

模型给出预测只是半成品,这章讲怎么把预测变成可回测的策略,并系统盘点回测陷阱:

  • 前视偏差:信号必须只用决策时点之前的信息——对应平台回测引擎”用前一日收盘决定持仓、当日结算收益”的铁律;
  • 幸存者偏差:用今天还活着的股票池回测历史,收益自动虚高(A 股退市少但 ST/停牌同理);
  • 过拟合回测:调参调到回测好看为止,等于把回测集用成了训练集——夏普该打几折,AFML 给出了公式;
  • 工具层面介绍 backtrader 与 zipline 的事件驱动框架。平台的向量化回测引擎更简单,但陷阱清单完全共用。

索引提示#

zipline 在国内数据源上水土不服,不必强行安装;读第 8 章时把”工具操作”跳过、把”陷阱清单”精读,性价比最高。

本页带走的三句话#

  1. 金融交叉验证禁止随机打乱:训练集必须永远早于验证集,泄漏是回测神话的头号来源;
  2. 线性模型是及格线——炫模型先跑赢岭回归再说话;
  3. 预测变策略的每一步都埋着前视/幸存者/过拟合三颗雷,平台回测引擎的 shift 纪律就是排雷动作。