1108 字
6 分钟
导读:预算只够一本,先读这本
原书:Machine Learning for Asset Managers(Marcos López de Prado,剑桥大学出版社 Elements in Quantitative Finance 系列,2020)。暂无中译本——它是一本约 150 页的小册子,八章、七个问题、每章附可运行代码。本精读为原创读书笔记:基于对原书方法与作者公开论文的理解重新组织表述,不是译文摘抄。
这本书在书架上的位置
它是《金融机器学习》(AFML,书屋有精读)的浓缩姊妹篇。同一个作者,两年之后,把 700 页大部头里最经得起实盘检验的东西提炼成 150 页。两本书的分工很清楚:
- AFML 讲全流程纪律:数据怎么采样、标签怎么打、交叉验证怎么防泄漏——它是一套完整的工程规范;
- 本书讲七把具体的刀:七个金融研究中反复出现的难题,每个难题给一件拿来就能用的 ML 工具。
所以书屋的建议是:预算(时间或金钱)只够一本,先读这本。读完觉得”我需要整套管线规范”,再去啃 AFML——那时你已经知道每章在解决什么问题了。
全书的核心论点:ML 是显微镜,不是水晶球
第一章开宗明义,也是全书最值得讲透的一句话:在金融里,ML 的正确用法是理论发现工具,而不是黑箱预测器。逻辑链条是:
- 金融数据信噪比极低、非平稳,黑箱预测模型学到的多半是噪声或过期规律,而市场会因为规律被利用而让它失效;
- 但 ML 极擅长在高维、非线性、多重共线的数据里找出”哪些变量重要、结构长什么样”——这恰是经典统计(p 值、线性回归)最弱的地方;
- 正确姿势因此是分工:ML 负责发现现象(找变量、找分组、找拐点),人负责提出可检验的经济理论解释它——最终上线的是理论,不是黑箱;
- 理论才可移植、可证伪、可在样本外存活——这是作者与”炼丹派”ML 量化最根本的分歧。
一个作者常用的类比:ML 之于金融研究者,如同显微镜之于生物学家——没人指责显微镜是黑箱,因为没人拿显微镜直接开药方。
七个问题,七把刀
| 章 | 问题 | 刀 |
|---|---|---|
| 2 | 协方差矩阵全是噪声 | Marcenko–Pastur 去噪 + 去调 |
| 3 | 相关系数量不出非线性关系 | 信息论距离(互信息、变差信息) |
| 4 | 分几组该由谁说了算 | ONC 最优聚类 |
| 5 | “明天涨不涨”是坏标签 | 趋势扫描 + 三重障碍 |
| 6 | p 值在金融里基本失效 | MDI / MDA / 聚类特征重要性 |
| 7 | 马科维茨优化是误差放大器 | NCO 嵌套聚类优化 |
| 8 | 回测试多了必出”圣杯” | 假策略定理 + 缩水夏普 |
本精读页码
| 页 | 对应原书 | 内容 |
|---|---|---|
| 2 | 第 2 章 | 去噪与去调:先给协方差矩阵洗澡 |
| 3 | 第 3~4 章 | 距离度量与最优聚类 |
| 4 | 第 5~6 章 | 金融标签与特征重要性 |
| 5 | 第 7 章 | 马科维茨的诅咒与 NCO |
| 6 | 第 8 章 | 回测过拟合的检测器 |
| 7 | 总结 | 一句话表 + 动手练习 + 下一本 |
阅读建议
- 门槛:比 AFML 低——需要基本线性代数(特征值)、基本统计(假设检验)和能读 Python;每章代码片段短,适合边读边跑;
- 和量化学堂的关系:学堂的防过拟合一课是本书第 8 章的动手入口;学堂案例里的因子相关性问题在第 2~4 章都有正面回答;
- 读法:第 1、6、8 章是灵魂(论点 + 显微镜 + 防自欺),赶时间先读这三章。
本页带走的三句话
- 本书是 AFML 的浓缩姊妹篇:AFML 给全流程纪律,这本给七把具体的刀——预算一本,先读这本;
- 核心论点:ML 在金融的正确岗位是理论发现工具(显微镜),不是黑箱预测器(水晶球)——最终上线的是理论;
- 七个问题贯穿全书:噪声协方差、非线性距离、聚类数、标签、特征重要性、组合优化、回测过拟合——每个都配了可运行的解法。