1088 字
5 分钟
研究议程与全书总结
最后一页:原书第 6 章展望了金融 ML 的开放问题,我们把它收进总结,配上章节速查表、动手练习和下一本的路标。
第 6 章:Nagel 的研究议程
作者列出的开放方向,对实践者同样是路标:
- 结构化的 ML:把资产定价理论(预算约束、均衡条件)直接编进模型架构,而不是只当事后检验——先验进得越深,数据要求越低;
- 信念数据:用调查预期、分析师预测检验”投资者像哪种学习算法”——第 5 章的模型可以被直接证伪;
- 另类数据的冷思考:文本、卫星图不改变信噪比的宿命,只是把高维问题变得更高维——数据越”另类”,越需要经济学先验压阵;
- 市场有效性的重述:当所有人都用 ML,“有效市场”的定义本身要改写——均衡是学习算法之间的均衡。
章节一句话速查表
| 原书章 | 一句话 |
|---|---|
| 1 导论 | 信噪比低、有效样本少、市场会学习——金融 ML 不能照搬别处的成功 |
| 2 监督学习 | 收缩与正则化不是技巧,是先验信念的数学表达 |
| 3 监督学习进资产定价 | 无套利 → 夏普有上限 → λ 可以从经济学推出来,不必交叉验证盲搜 |
| 4 横截面资产定价 | 因子动物园的解法是全量收缩;稀疏的”真因子名单”是幻觉 |
| 5 投资者信念形成 | 样本内可预测性可能是市场集体学习误差的化石,当时无人能赚 |
| 6 研究议程 | 先验进得越深越好;均衡是学习算法之间的均衡 |
全书总结:四句话
- 金融 ML 的核心矛盾是”高维方法”遇上”低信噪比 + 小样本”——解法不是更大的模型,而是更好的先验;
- 每个正则化选择都是一个经济学命题,交叉验证不能替你回答”市场里最多存在多高的夏普”;
- 定价信息弥散而不稀疏:追问”哪个因子最重要”不如追问”新信息在已有空间之外还有没有增量”;
- 市场是学习系统:回测高估未来是结构性的,不是你不够小心。
动手练习(在本平台)
- 体会收缩:对同一批因子分别做等权合成与 IC 加权合成,比较样本外表现——等权就是最强收缩(先验:人人平等),感受一下”收缩反而更稳”;
- 给夏普设先验:翻出你回测过的最好策略,问自己”我信 A 股存在这个数量级的近似套利吗”,把答案写进研究笔记,作为以后所有回测的体检线;
- 模拟实时学习者:选一个因子,只用 2019 年前的数据决定参数,然后看 2020 年后的表现;再与”全样本调参”的成绩对比——差距就是第 5 章说的后视镜特权;
- 复习量化学堂过拟合一课,把”研究者过拟合”与”学习误差化石”两层折扣写进你的回测报告模板。
下一本读什么
- 想把本书的理论警告落成工程操作:读(或重读)书屋的《金融机器学习》精读——缩水夏普、PBO 就是给本书结论配的扳手;
- 想补上因子研究的实证功课:《因子投资:方法与实践》——译者石川的本行,与本书互为表里;
- 想看”市场会学习”的血肉版本:《宽客》——2007 年 8 月量化集体踩踏,就是所有人学会同一件事的代价。
本页带走的三句话
- 解法不是更大的模型,而是更好的先验——先验进得越深,对数据的要求越低;
- 回测高估未来是结构性的:对手方在变聪明,静态历史不会告诉你这一点;
- 读完本书再看任何”AI 炒股”叙事,你都该先问三个问题——信噪比多少、有效样本多少、这个规律被学走要多久。