导读:想给平台加 ML 因子,从这本开始
原书:Machine Learning for Algorithmic Trading, 2nd Edition(Stefan Jansen,Packt,2020),中译《机器学习在算法交易中的应用》(中国水利水电出版社,2023)。中译整体可读但有机翻痕迹、术语偶有前后不一,代码一律以配套 GitHub 仓库 stefan-jansen/machine-learning-for-trading 为准(万星级仓库,150+ 个 notebook,作者持续维护)。
关于本精读:原创读书笔记,按原书四大部分分组精读(原书 23 章 + 附录、800 多页,第二部分最重,拆为上下两页)。这本书的正确用法不是从头读到尾,而是当使用地图 + 案头索引——本精读的任务就是告诉你哪些章值得精读、哪些章翻过知道在哪即可。
这本书在书架上的位置
书屋的五本机器学习书里,这一本与本平台的定位最契合:它是工程手册——从数据接入、alpha 因子工程、模型训练到回测评估,一条完整流水线全部给出可运行代码。一句话:想给 AlphaForge 加 ML 因子,从它开始。
和已上架的《金融机器学习》分工明确:
| 书 | 回答的问题 |
|---|---|
| 《金融机器学习》(López de Prado) | 金融 ML 为什么会失败?(方法论与防坑) |
| 《机器学习在算法交易中的应用》(Jansen) | 整条 ML 流水线怎么搭起来?(工程与代码) |
先用 Jansen 搭出能跑的东西,再用 AFML 的纪律去审判它——顺序反过来会既不会写、又只会怕。
作者与这本书的底色
Stefan Jansen 是数据科学咨询公司创始人,做过对冲基金的宏观研究。这本书的气质是教科书 + 代码仓库的混合体:每章先讲清一个领域的核心概念,再给一个金融场景的完整实现。第 2 版(2020)相比第 1 版大幅重写,补了梯度提升实盘化细节、自编码器资产定价、GAN 合成数据和深度强化学习。
先把丑话说完,这本书广而不深:23 章横跨数据工程、经典 ML、NLP、深度学习、强化学习,每一章都是一个可以写整本专著的领域的导览。它给你的是”全景图 + 能跑通的起点”,不是任何单点的最深理解——单点要深入,得顺着每章末尾的文献清单往下挖。
四大部分与本精读页码
| 页 | 部分(原书章) | 学到什么程度够用 |
|---|---|---|
| 2 | 第一部分:数据与 alpha 因子(1~5 章) | 会用 alpha 因子工程套路造因子、用 IC 体检 |
| 3 | 第二部分(上):ML 工作流骨架(6~8 章) | 懂金融交叉验证的特殊性,会接回测 |
| 4 | 第二部分(下):时间序列到梯度提升(9~13 章) | 会用 LightGBM 跑通第一个 ML 因子 |
| 5 | 第三部分:NLP 文本信号(14~16 章) | 知道文本→信号的流水线长什么样 |
| 6 | 第四部分:深度学习与强化学习(17~23 章) | 知道 DL/RL 能做什么、暂时不必做什么 |
| 7 | 全书总结 | 精读/索引清单 + 动手练习 |
阅读建议
- 精读主干:第 4 章(alpha 因子工程)、第 6~8 章(ML 流程与回测衔接)、第 12 章(梯度提升)——这五章构成”给平台加 ML 因子”的最短路径;
- 当索引:数据源细节章(2、3)、NLP 三章、深度学习各章——用到哪类数据/模型再回来查;
- 环境提醒:原书数据管道围绕美股(Quandl Wiki、Nasdaq ITCH、SEC EDGAR),部分免费源已停更;A 股用户直接用本平台 PostgreSQL 里的数据当替身,思路完全通用;
- 配套仓库是半本书:装好 conda 环境、跑 notebook,比只读纸面效率高一倍。
本页带走的三句话
- 这是一本工程手册:想给平台加 ML 因子,从它开始,从头通读则是误用;
- 它广而不深——每章是导览不是专著,价值在全景图和能跑通的代码;
- 与《金融机器学习》搭配:Jansen 教你搭起来,AFML 教你别骗自己。