1088 字
5 分钟

研究议程与全书总结

最后一页:原书第 6 章展望了金融 ML 的开放问题,我们把它收进总结,配上章节速查表、动手练习和下一本的路标。

第 6 章:Nagel 的研究议程#

作者列出的开放方向,对实践者同样是路标:

  • 结构化的 ML:把资产定价理论(预算约束、均衡条件)直接编进模型架构,而不是只当事后检验——先验进得越深,数据要求越低;
  • 信念数据:用调查预期、分析师预测检验”投资者像哪种学习算法”——第 5 章的模型可以被直接证伪;
  • 另类数据的冷思考:文本、卫星图不改变信噪比的宿命,只是把高维问题变得更高维——数据越”另类”,越需要经济学先验压阵
  • 市场有效性的重述:当所有人都用 ML,“有效市场”的定义本身要改写——均衡是学习算法之间的均衡。

章节一句话速查表#

原书章一句话
1 导论信噪比低、有效样本少、市场会学习——金融 ML 不能照搬别处的成功
2 监督学习收缩与正则化不是技巧,是先验信念的数学表达
3 监督学习进资产定价无套利 → 夏普有上限 → λ 可以从经济学推出来,不必交叉验证盲搜
4 横截面资产定价因子动物园的解法是全量收缩;稀疏的”真因子名单”是幻觉
5 投资者信念形成样本内可预测性可能是市场集体学习误差的化石,当时无人能赚
6 研究议程先验进得越深越好;均衡是学习算法之间的均衡

全书总结:四句话#

  1. 金融 ML 的核心矛盾是”高维方法”遇上”低信噪比 + 小样本”——解法不是更大的模型,而是更好的先验;
  2. 每个正则化选择都是一个经济学命题,交叉验证不能替你回答”市场里最多存在多高的夏普”;
  3. 定价信息弥散而不稀疏:追问”哪个因子最重要”不如追问”新信息在已有空间之外还有没有增量”;
  4. 市场是学习系统:回测高估未来是结构性的,不是你不够小心。

动手练习(在本平台)#

  1. 体会收缩:对同一批因子分别做等权合成与 IC 加权合成,比较样本外表现——等权就是最强收缩(先验:人人平等),感受一下”收缩反而更稳”;
  2. 给夏普设先验:翻出你回测过的最好策略,问自己”我信 A 股存在这个数量级的近似套利吗”,把答案写进研究笔记,作为以后所有回测的体检线;
  3. 模拟实时学习者:选一个因子,只用 2019 年前的数据决定参数,然后看 2020 年后的表现;再与”全样本调参”的成绩对比——差距就是第 5 章说的后视镜特权;
  4. 复习量化学堂过拟合一课,把”研究者过拟合”与”学习误差化石”两层折扣写进你的回测报告模板。

下一本读什么#

  • 想把本书的理论警告落成工程操作:读(或重读)书屋的《金融机器学习》精读——缩水夏普、PBO 就是给本书结论配的扳手;
  • 想补上因子研究的实证功课:《因子投资:方法与实践》——译者石川的本行,与本书互为表里;
  • 想看”市场会学习”的血肉版本:《宽客》——2007 年 8 月量化集体踩踏,就是所有人学会同一件事的代价。

本页带走的三句话#

  1. 解法不是更大的模型,而是更好的先验——先验进得越深,对数据的要求越低;
  2. 回测高估未来是结构性的:对手方在变聪明,静态历史不会告诉你这一点;
  3. 读完本书再看任何”AI 炒股”叙事,你都该先问三个问题——信噪比多少、有效样本多少、这个规律被学走要多久。