892 字
4 分钟
第二部分(上):ML 工作流的骨架(第 6~8 章)
原书第二部分共八章(6~13),是全书篇幅最大的板块。本页先讲骨架三章:ML 流程(第 6 章)、线性模型(第 7 章)、从模型到回测的 ML4T 工作流(第 8 章)。这三章是”给平台加 ML 因子”绕不开的地基,建议精读。
第 6 章:机器学习流程(金融特供版)
标准内容(监督/无监督、偏差-方差权衡、sklearn Pipeline)任何 ML 书都有,这章的金融特供价值在交叉验证:
- 金融数据禁止随机打乱:样本有时间顺序,随机 K 折会让模型”用未来验证过去”,分数虚高——必须用时间序列拆分(训练集永远早于验证集);
- 泄漏无处不在:特征里混进未来信息(用当天收盘价算的因子去预测当天收益)、标准化时用全样本均值——每一种都能造出回测神话;
- 更严格的 Purged K-Fold(清除重叠样本)在《金融机器学习》里展开,两本书在这里握手。
对照平台:research/dataset.py 计算前向收益时因子值与收益错开一天,就是在源头掐断泄漏——读这章你会明白那行代码为什么神圣。
第 7 章:线性模型——所有炫模型的及格线
从因子模型传统讲到收益预测:OLS 的假设与诊断、岭回归/Lasso 正则化、逻辑回归做涨跌方向分类,以及学术界标配的 Fama-MacBeth 回归(先截面后时序,估计因子风险溢价)。
这章最重要的不是技术,是态度:线性模型是基准。信噪比这么低的数据上,非线性模型的花哨容量大多用来拟合噪声——任何深度模型上场前,先让它跑赢岭回归,跑不赢就别浪费算力。这也是给平台加模型层的推荐路径:第一版就用线性回归把多个因子合成一个打分,能跑通、能解释、不易过拟合。
第 8 章:ML4T 工作流——从模型到策略回测(必精读)
模型给出预测只是半成品,这章讲怎么把预测变成可回测的策略,并系统盘点回测陷阱:
- 前视偏差:信号必须只用决策时点之前的信息——对应平台回测引擎”用前一日收盘决定持仓、当日结算收益”的铁律;
- 幸存者偏差:用今天还活着的股票池回测历史,收益自动虚高(A 股退市少但 ST/停牌同理);
- 过拟合回测:调参调到回测好看为止,等于把回测集用成了训练集——夏普该打几折,AFML 给出了公式;
- 工具层面介绍 backtrader 与 zipline 的事件驱动框架。平台的向量化回测引擎更简单,但陷阱清单完全共用。
索引提示
zipline 在国内数据源上水土不服,不必强行安装;读第 8 章时把”工具操作”跳过、把”陷阱清单”精读,性价比最高。
本页带走的三句话
- 金融交叉验证禁止随机打乱:训练集必须永远早于验证集,泄漏是回测神话的头号来源;
- 线性模型是及格线——炫模型先跑赢岭回归再说话;
- 预测变策略的每一步都埋着前视/幸存者/过拟合三颗雷,平台回测引擎的 shift 纪律就是排雷动作。