1015 字
5 分钟
总结:七把刀的收纳与下一本
150 页的小册子读完了。这一页把七把刀收进一张表,给出平台上的动手清单,并回答”接下来读什么”。
逐章一句话(快速复习卡)
| 章 | 主题 | 一句话 |
|---|---|---|
| 1 | 动机 | ML 是理论发现工具(显微镜),不是黑箱预测器(水晶球) |
| 2 | 去噪与去调 | 噪声特征值的形状可由 Marcenko–Pastur 精确算出——只熨噪声,不动信号 |
| 3 | 距离度量 | 相关系数只懂线性;互信息 / 变差信息才量得出任意依赖 |
| 4 | 最优聚类 | 分几组不拍脑袋:ONC 用轮廓系数 + 递归修补让数据自己报数 |
| 5 | 金融标签 | 趋势扫描:哪个窗口趋势 t 值最大,标签就看多远 |
| 6 | 特征重要性 | p 值在金融失效;MDI/MDA + 特征聚类是替代的显微镜 |
| 7 | 组合构建 | 马科维茨的诅咒:最需要分散时优化器最不可靠——NCO 拆小再优化 |
| 8 | 回测过拟合 | 最大回测夏普的期望随 √(2 ln N) 增长——夏普必须连同试验次数一起报 |
全书总结:四句话
- 金融数据信噪比太低,黑箱预测活不长;ML 的可持续用法是发现结构、启发理论,最终上线的是理论;
- 一条工具链贯穿全书:去噪去调 → 信息论距离 → 聚类——它先后支撑了特征重要性、NCO 和去伪存真的相关性分析;
- 经典统计的两根支柱(p 值、均值-方差优化)在金融里都已塌方,本书给的替代品都遵循同一原则:对估计误差鲁棒优先于理论最优;
- 一切研究的最后一关是第 8 章:不做多重检验校正的回测,读作”发现”,写作”噪声”。
在本平台动手(按难度排序)
- 试验账本(第 8 章,零代码):从今天起记录每次
factor analyze/backtest run的参数与结果——DSR 的输入 N 从此有据可查; - 因子相关性体检(第 2~4 章):取
factor_value中所有因子的收益序列,算相关距离并聚类;被分进同组的因子,留 IC 最稳的一个,其余归档; - 趋势扫描标签(第 5 章):对沪深 300 成分股跑一次趋势扫描(窗口 5~20 天),对比”固定 5 天涨跌”标签,看两者分歧率有多高——分歧处通常正是波动率变化处;
- 穷人版 DSR(第 8 章):翻开账本数出你在当前因子上的真实试验次数 N,用 √(2 ln N) 估算”运气及格线”,再看你的最优夏普高出多少。
和书屋其他书的关系
- AFML:同作者的全流程规范。本书是先导——七把刀觉得趁手,再去 AFML 补数据管线、标签工程、Purged K-Fold 的完整纪律;
- 《因子投资》:它的多重检验章节与本书第 8 章互为印证——一个给文献综述与 t>3 经验值,一个给推导和计算器;
- 《打开量化投资的黑箱》:“误差最大化器”的批评在本书第 7 章拿到了定量版本(条件数)与解药(NCO)。
下一本读什么
- 想补全流程纪律 → AFML《金融机器学习》(书屋有精读,本书读完后是最佳时机);
- 想看”对误差鲁棒”哲学的散文版 → 《随机漫步的傻瓜》(书屋有精读);
- 想动手 → 不读了,先去量化学堂防过拟合一课,把试验账本建起来。
本页带走的三句话
- 七把刀共用一个刀柄:对估计误差鲁棒优先于理论最优——去噪、聚类、NCO、DSR 全是这一句的变奏;
- ML 在金融的宿命不是替你预测,而是帮你更快地发现值得建理论的现象;
- 本书与 AFML 的分工:这本给工具,那本给纪律——工具一天上手,纪律终身修行。