722 字
4 分钟
导读:机器学习进场前的安全手册
原书:Advances in Financial Machine Learning(Marcos López de Prado),中译《金融机器学习》。作者是管理过百亿美元的量化基金经理 + 机器学习学者,这本书的底色是一句冷水:大多数金融机器学习项目会失败,而且失败的方式高度雷同。
这本书在书架上的位置
书屋里其他书教你线性时代的功夫(因子、IC、回归),这本书回答下一个必然出现的问题:“我能不能用机器学习挖因子?”
它的回答很独特——四分之一讲怎么用,四分之三讲为什么你现在这样用必死。作者的名言(大意):“金融机器学习的失败,99% 不是算法问题,是数据处理和回测方法问题。“这正是它对本平台用户的价值:哪怕你永远不用深度学习,它对回测方法论的批判也直接适用于线性因子研究。
作者是谁
Marcos López de Prado:康奈尔大学教授,先后在 Tudor、Guggenheim(管理 130 亿美元量化策略)、AQR 任职,后创立自己的机构。学术和实盘双栖,书中每个方法都标注了”这是实盘验证过的”还是”这是学术玩具”——这种诚实在教材里很罕见。
为什么金融 ML 特别难(全书的问题设定)
机器学习在图像、语言上大杀四方,到金融就翻车,因为金融数据有四大恶劣特性:
- 信噪比极低:图片里猫就是猫;股价里 99% 是噪声,信号细若游丝;
- 样本量假象:十年日线看似几千个样本,但市场机制变迁意味着真正同分布的样本少得可怜;
- 非独立同分布:样本之间高度相关(重叠的持有期、共同的市场状态)——而几乎所有 ML 工具都假设 i.i.d.;
- 市场会反击:猫不会因为被识别就变成狗,市场规律会因为被利用而消失。
本精读页码(按原书板块逐部分展开)
| 页 | 部分 | 内容 |
|---|---|---|
| 2 | 数据结构(上) | Bars 理论:别用时间切数据 |
| 3 | 数据结构(下) | 三重障碍标签与元标签 |
| 4 | 样本权重 | 唯一性加权与分数差分 |
| 5 | 模型评估 | Purged K-Fold:交叉验证与泄漏 |
| 6 | 回测方法论 | Deflated Sharpe、PBO 与 HRP |
| 7 | 总结 | 七条军规 + 决策树 + 复习卡 |
阅读建议
- 门槛:需要 Python 熟练 + 基本 ML 概念(交叉验证、随机森林)——建议排在书屋所有书之后读;
- 就算不做 ML,第 5~6 页(回测方法论批判)也强烈建议读——它对”多次回测后的夏普该打几折”给出了可计算的答案;
- 原书代码全部公开,适合边读边跑。