1011 字
5 分钟

导读:机器学习在金融的理论边界

原书:Machine Learning in Asset Pricing(Stefan Nagel, Princeton University Press, 2021),中译《机器学习与资产定价》(电子工业出版社 2022,王熙、石川 译,豆瓣 8.0)。中译质量很高——译者之一石川正是书屋《因子投资》的作者,书中的译者注常常替读者补上关键推导和 A 股语境,是加分项。本精读为原创读书笔记,不是原文摘录或翻译。

这本书在书架上的位置#

书屋里已经有一本讲金融 ML 的书:《金融机器学习》(AFML)。两本的分工非常清楚——

  • AFML 讲工程纪律:数据怎么采样、标签怎么打、回测怎么防过拟合,是”操作规程”;
  • Nagel 讲理论边界:ML 在金融原则上能做到什么、做不到什么,收缩和正则化在经济学上意味着什么,是”物理定律”。

先读 AFML 你会得到一套动作;读完 Nagel 你才知道这些动作为什么必要、天花板在哪里。

作者是谁#

Stefan Nagel:芝加哥大学布斯商学院金融学教授(Fama Family 讲席——办公室名字就挂着有效市场之父),Journal of Finance 前主编。他与 Kozak、Santosh 合作的”收缩横截面”系列论文,是学界用 ML 处理”因子动物园”的代表作。这本书脱胎于他 2019 年的普林斯顿金融讲座,160 页,薄而密。

全书的核心问题:为什么 ML 在金融不能照搬#

ML 在图像、语言上的成功建立在三个条件上,而金融市场恰好三个都不满足:

  1. 信噪比极低:识别猫的任务里信号占绝对主导;预测收益的任务里,可预测成分对收益方差的贡献通常不到百分之几——模型面对的几乎全是噪声;
  2. 样本永远不够:图像可以无限标注,市场历史只有一份,而且宏观状态几十年才轮换几次——有效样本量小到让”大数据”这个词失去意义
  3. 市场会学习:猫不会因为被识别而变成狗,但可预测模式会因为被交易而消失——你的对手方也在跑同样的算法。

Nagel 的回答不是”所以别用 ML”,而是:正因如此,金融 ML 的每一个超参数都应该由经济学推理来定,而不是交给交叉验证自动搜索。这是全书的主线。

本精读页码(按原书六章展开)#

原书章内容
2第 2 章 监督学习收缩与正则化的贝叶斯解释:惩罚项就是先验
3第 3 章 监督学习进资产定价经济学先验:用夏普比率上限定超参数
4第 4 章 横截面资产定价因子动物园的收缩解法(Kozak–Nagel–Santosh)
5第 5 章 投资者信念形成市场也在学习:样本内可预测性的幻觉
6第 6 章 + 总结研究议程、章节速查表、动手练习

阅读建议#

  • 门槛:需要线性回归和基础概率(知道什么是先验/后验更好),比 AFML 更偏理论但数学不深,公式都有直觉解释;
  • 建议阅读顺序:《因子投资》→ 本书 → AFML——先知道因子研究的常规做法,再理解它的统计本质,最后学工程防坑;
  • 读前可先复习量化学堂的过拟合一课:本书第 2~3 页回答的正是”为什么惩罚项能防过拟合”这个更深一层的问题。

本页带走的三句话#

  1. AFML 讲工程纪律,Nagel 讲理论边界:一个教动作,一个讲天花板;
  2. 金融 ML 三大障碍——信噪比低、有效样本少、市场会学习——决定了照搬图像语音的成功经验必死;
  3. 全书主线一句话:超参数不该由交叉验证盲搜,应该由经济学先验来定。