1021 字
5 分钟

实践军规与全书总结

最后一页:把 López de Prado 的方法论收成一张军规清单,并给”要不要上机器学习”一个诚实的决策树。

七条金融 ML 军规#

  1. 先修数据,再谈模型:采样方式、标签定义、样本加权——数据管线的设计决定项目生死,模型选择只是最后 10%;
  2. 让 ML 做二级决策:方向交给有经济逻辑的信号(因子),ML 只回答”该不该信、下多大注”(元标签)——黑箱越靠近钱,越要小;
  3. 时间序列禁用普通交叉验证:只用 Purged K-Fold + embargo;任何打乱时间顺序的评估方法先默认它错;
  4. 每个回测都带”账本”:试验次数、参数搜索范围全程记录——没有账本的夏普是无法审计的夏普;
  5. 报告缩水后的指标:Deflated Sharpe、PBO——校正多重检验之后还活着的策略才算活着;
  6. 特征重要性优先于预测精度:ML 在金融最大的正当用途是理解(哪些特征携带信息、何时携带)而不是黑箱预测——先当显微镜用,再当水晶球用;
  7. 对”理论最优”保持怀疑:HRP 打败马科维茨优化的原因(对输入误差稳健)适用于一切场景——样本外稳健性是唯一的裁判。

要不要上机器学习:诚实决策树#

线性因子的功课做完了吗(IC/分层/多重检验/样本外)?
├─ 没有 → 先别碰 ML,回去补课(收益更大)
└─ 做完了 →
有干净的数据管线和试验账本吗?
├─ 没有 → 先建基础设施(本书前半部分)
└─ 有 →
从元标签开始(ML 做仓位/过滤),
而不是从"深度学习预测涨跌"开始

这个顺序不是保守主义,是投入产出比:在金融里,方法论的收益 > 算法的收益,几乎没有例外。

逐部分一句话(快速复习卡)#

部分一句话
数据结构(bars)“日线”不是自然事实,采样方式是建模决策
标签与元标签模型该学”交易怎么结束”;方向靠逻辑,ML 管仓位
样本权重回测天数 ≠ 独立证据数
交叉验证打乱时间顺序 = 让未来混进过去
回测过拟合试验次数必须进入显著性折算

全书总结:五句话#

  1. 金融 ML 的失败 99% 死于数据处理和回测方法,不是算法不够新;
  2. 采样、标签、样本加权是建模决策——“日线 + 明天涨跌”不是天经地义;
  3. 试够多的次数,纯噪声也能给你夏普 2——试验次数必须进入显著性折算(Deflated Sharpe / PBO);
  4. ML 先当显微镜(特征理解),再当水晶球(预测);方向靠逻辑,ML 管仓位;
  5. 样本外稳健性是唯一的裁判——对输入误差稳健的朴素方法,长期打败理论最优。

和其他书的关系#

  • 它是《因子投资》多重检验章节的工程完全体:从”要警惕”升级到”这么算”;
  • 它和《随机漫步的傻瓜》互为表里:塔勒布讲人为什么自欺,本书讲怎么用流程防自欺;
  • 它是书屋的”最后一本书”:读完它,你对整个量化研究流程的怀疑精神就完整了。

在本平台试一试#

  1. 给自己建”试验账本”:从今天起记录每次因子尝试(名称、参数、结果、弃用原因)——一个月后你会震惊于自己的真实尝试次数;
  2. 对你最好的因子做穷人版 PBO:把回测区间对半切,前半段选出的”最优参数”,在后半段还是最优吗?
  3. 体会样本重叠:同一因子 period=20 时,相邻两期 IC 共享 19 天信息——把 IC 样本期数除以 period 再看 t 值,感受”有效样本”缩水多少。