1108 字
6 分钟

导读:预算只够一本,先读这本

原书:Machine Learning for Asset Managers(Marcos López de Prado,剑桥大学出版社 Elements in Quantitative Finance 系列,2020)。暂无中译本——它是一本约 150 页的小册子,八章、七个问题、每章附可运行代码。本精读为原创读书笔记:基于对原书方法与作者公开论文的理解重新组织表述,不是译文摘抄。

这本书在书架上的位置#

它是《金融机器学习》(AFML,书屋有精读)的浓缩姊妹篇。同一个作者,两年之后,把 700 页大部头里最经得起实盘检验的东西提炼成 150 页。两本书的分工很清楚:

  • AFML 讲全流程纪律:数据怎么采样、标签怎么打、交叉验证怎么防泄漏——它是一套完整的工程规范;
  • 本书讲七把具体的刀:七个金融研究中反复出现的难题,每个难题给一件拿来就能用的 ML 工具。

所以书屋的建议是:预算(时间或金钱)只够一本,先读这本。读完觉得”我需要整套管线规范”,再去啃 AFML——那时你已经知道每章在解决什么问题了。

全书的核心论点:ML 是显微镜,不是水晶球#

第一章开宗明义,也是全书最值得讲透的一句话:在金融里,ML 的正确用法是理论发现工具,而不是黑箱预测器。逻辑链条是:

  1. 金融数据信噪比极低、非平稳,黑箱预测模型学到的多半是噪声或过期规律,而市场会因为规律被利用而让它失效;
  2. 但 ML 极擅长在高维、非线性、多重共线的数据里找出”哪些变量重要、结构长什么样”——这恰是经典统计(p 值、线性回归)最弱的地方;
  3. 正确姿势因此是分工:ML 负责发现现象(找变量、找分组、找拐点),人负责提出可检验的经济理论解释它——最终上线的是理论,不是黑箱;
  4. 理论才可移植、可证伪、可在样本外存活——这是作者与”炼丹派”ML 量化最根本的分歧。

一个作者常用的类比:ML 之于金融研究者,如同显微镜之于生物学家——没人指责显微镜是黑箱,因为没人拿显微镜直接开药方

七个问题,七把刀#

问题
2协方差矩阵全是噪声Marcenko–Pastur 去噪 + 去调
3相关系数量不出非线性关系信息论距离(互信息、变差信息)
4分几组该由谁说了算ONC 最优聚类
5“明天涨不涨”是坏标签趋势扫描 + 三重障碍
6p 值在金融里基本失效MDI / MDA / 聚类特征重要性
7马科维茨优化是误差放大器NCO 嵌套聚类优化
8回测试多了必出”圣杯”假策略定理 + 缩水夏普

本精读页码#

对应原书内容
2第 2 章去噪与去调:先给协方差矩阵洗澡
3第 3~4 章距离度量与最优聚类
4第 5~6 章金融标签与特征重要性
5第 7 章马科维茨的诅咒与 NCO
6第 8 章回测过拟合的检测器
7总结一句话表 + 动手练习 + 下一本

阅读建议#

  • 门槛:比 AFML 低——需要基本线性代数(特征值)、基本统计(假设检验)和能读 Python;每章代码片段短,适合边读边跑;
  • 和量化学堂的关系:学堂的防过拟合一课是本书第 8 章的动手入口;学堂案例里的因子相关性问题在第 2~4 章都有正面回答;
  • 读法:第 1、6、8 章是灵魂(论点 + 显微镜 + 防自欺),赶时间先读这三章。

本页带走的三句话#

  1. 本书是 AFML 的浓缩姊妹篇:AFML 给全流程纪律,这本给七把具体的刀——预算一本,先读这本;
  2. 核心论点:ML 在金融的正确岗位是理论发现工具(显微镜),不是黑箱预测器(水晶球)——最终上线的是理论;
  3. 七个问题贯穿全书:噪声协方差、非线性距离、聚类数、标签、特征重要性、组合优化、回测过拟合——每个都配了可运行的解法。