829 字
4 分钟
全书总结:使用地图与第一个 ML 因子
全书压缩成一段话
这本 800 页的工程手册把”ML 进入量化”的整条流水线铺了一遍:数据与另类数据的评估框架、alpha 因子工程的标准作业程序(经济逻辑 → 向量化实现 → IC 体检)、金融特供的 ML 流程(时间序列拆分、防泄漏)、从线性基准到梯度提升的模型谱系、NLP 文本信号流水线、深度学习与强化学习的全景导览。它广而不深,但作为使用地图无可替代——配套万星代码仓库让每一章都能跑起来。
四大部分一句话(快速复习卡)
| 部分 | 一句话 |
|---|---|
| 一、数据与 alpha 因子(1~5 章) | 因子工程三步走:经济逻辑、pandas 实现、IC 体检 |
| 二、ML 基础(6~13 章) | 交叉验证禁止打乱;线性是及格线,梯度提升是首选 |
| 三、NLP(14~16 章) | 文本难在上游清洗,下游检验与价量因子同一套 |
| 四、深度与强化学习(17~23 章) | 打不过 LightGBM 就用 LightGBM;alpha 来自特征 |
精读 / 索引清单(本精读的最终判决)
| 读法 | 章 |
|---|---|
| 必精读 | 4(因子工程)、6(ML 流程)、7(线性基准)、8(回测衔接)、12(梯度提升) |
| 选读 | 5(组合)、9(时间序列)、13(无监督)、17(DL 概念) |
| 当索引 | 2、3(数据源)、10、11、14~16(用到再查) |
| 开眼界 | 18~22(CNN/RNN/自编码器/GAN/RL) |
动手练习:用第 4 章的套路给平台写一个新因子
按”经济逻辑 → 实现 → 体检”三步,写一个波动率调整动量因子(动量家族 + 风险调整,正是书中反复出现的组合):
- 经济逻辑:裸动量在 A 股不稳定,高波动股的动量常是噪声——用波动率去缩放,留下”涨得稳”的部分;
- 实现:在
src/alphaforge/research/factors.py里注册:20 日收益除以 20 日日收益标准差(ret.rolling(20).sum() / ret.rolling(20).std()的思路),几行 pandas 即可; - 体检:CLI 跑
factor compute+factor analyze,对照裸动量看 IC、ICIR、分层单调性有没有改善——完整操作路径见量化学堂案例三,那一课就是为这个练习准备的。
做完这一步,你就走完了书中第 4 章的完整闭环;下一步把它和平台已有因子一起喂给 LightGBM(第 12 章路线),就是平台 ML 因子的 1.0 版。
下一本
- 《金融机器学习》(López de Prado):Jansen 教你把流水线搭起来,AFML 教你在每个环节防自欺——样本重叠、回测过拟合、多重检验的定量解药。先搭后审,两本连读才完整;
- 觉得模型还烫手,就先回量化学堂把案例三做完——动手永远排在读下一本之前。
带走的五句话
- 想给平台加 ML 因子,路线图是:第 4 章造特征 → 第 6/8 章立规矩 → 第 12 章上 LightGBM;
- 金融交叉验证禁止随机打乱,泄漏是回测神话的头号来源;
- 线性模型是及格线,梯度提升是表格数据默认答案,深度模型须先自证;
- alpha 主要来自特征工程,模型只负责最后一公里;
- 这本书当地图和索引用——通读是误用,跑通代码才算读过。