1032 字
5 分钟

导读:想给平台加 ML 因子,从这本开始

原书:Machine Learning for Algorithmic Trading, 2nd Edition(Stefan Jansen,Packt,2020),中译《机器学习在算法交易中的应用》(中国水利水电出版社,2023)。中译整体可读但有机翻痕迹、术语偶有前后不一,代码一律以配套 GitHub 仓库 stefan-jansen/machine-learning-for-trading 为准(万星级仓库,150+ 个 notebook,作者持续维护)。

关于本精读:原创读书笔记,按原书四大部分分组精读(原书 23 章 + 附录、800 多页,第二部分最重,拆为上下两页)。这本书的正确用法不是从头读到尾,而是当使用地图 + 案头索引——本精读的任务就是告诉你哪些章值得精读、哪些章翻过知道在哪即可。

这本书在书架上的位置#

书屋的五本机器学习书里,这一本与本平台的定位最契合:它是工程手册——从数据接入、alpha 因子工程、模型训练到回测评估,一条完整流水线全部给出可运行代码。一句话:想给 AlphaForge 加 ML 因子,从它开始。

和已上架的《金融机器学习》分工明确:

回答的问题
《金融机器学习》(López de Prado)金融 ML 为什么会失败?(方法论与防坑)
《机器学习在算法交易中的应用》(Jansen)整条 ML 流水线怎么搭起来?(工程与代码)

先用 Jansen 搭出能跑的东西,再用 AFML 的纪律去审判它——顺序反过来会既不会写、又只会怕。

作者与这本书的底色#

Stefan Jansen 是数据科学咨询公司创始人,做过对冲基金的宏观研究。这本书的气质是教科书 + 代码仓库的混合体:每章先讲清一个领域的核心概念,再给一个金融场景的完整实现。第 2 版(2020)相比第 1 版大幅重写,补了梯度提升实盘化细节、自编码器资产定价、GAN 合成数据和深度强化学习。

先把丑话说完,这本书广而不深:23 章横跨数据工程、经典 ML、NLP、深度学习、强化学习,每一章都是一个可以写整本专著的领域的导览。它给你的是”全景图 + 能跑通的起点”,不是任何单点的最深理解——单点要深入,得顺着每章末尾的文献清单往下挖。

四大部分与本精读页码#

部分(原书章)学到什么程度够用
2第一部分:数据与 alpha 因子(1~5 章)会用 alpha 因子工程套路造因子、用 IC 体检
3第二部分(上):ML 工作流骨架(6~8 章)懂金融交叉验证的特殊性,会接回测
4第二部分(下):时间序列到梯度提升(9~13 章)会用 LightGBM 跑通第一个 ML 因子
5第三部分:NLP 文本信号(14~16 章)知道文本→信号的流水线长什么样
6第四部分:深度学习与强化学习(17~23 章)知道 DL/RL 能做什么、暂时不必做什么
7全书总结精读/索引清单 + 动手练习

阅读建议#

  • 精读主干:第 4 章(alpha 因子工程)、第 6~8 章(ML 流程与回测衔接)、第 12 章(梯度提升)——这五章构成”给平台加 ML 因子”的最短路径;
  • 当索引:数据源细节章(2、3)、NLP 三章、深度学习各章——用到哪类数据/模型再回来查;
  • 环境提醒:原书数据管道围绕美股(Quandl Wiki、Nasdaq ITCH、SEC EDGAR),部分免费源已停更;A 股用户直接用本平台 PostgreSQL 里的数据当替身,思路完全通用;
  • 配套仓库是半本书:装好 conda 环境、跑 notebook,比只读纸面效率高一倍。

本页带走的三句话#

  1. 这是一本工程手册:想给平台加 ML 因子,从它开始,从头通读则是误用;
  2. 它广而不深——每章是导览不是专著,价值在全景图和能跑通的代码;
  3. 与《金融机器学习》搭配:Jansen 教你搭起来,AFML 教你别骗自己。