1011 字
5 分钟

第二道工序:收益预测——低信噪比下的机器学习

对应原书第 2 章主体(Forecasting),全书篇幅最大、公式最密的一章。原书无中译;本页为原创导读笔记,讲问题结构与取舍,不复述推导。

问题设定:先接受信噪比#

统计套利预测的现实:单个信号与未来收益的相关性(IC)通常只有百分之几,对应 R² 万分之几的量级。生意能成立靠的不是预测准,而是大数定律——几千只股票 × 几百个交易日 × 很小的正期望,聚合出可观的夏普。这个设定决定了本章一切取舍:任何在高信噪比领域(图像、语言)成立的 ML 经验,搬过来都要先打个问号。

技术类预测:两大原型#

  • 均值回归:中频 statarb 的传统主粮——股价相对同类(行业、相关篮子)的短期偏离会部分收敛。它本质是给市场提供流动性,收益来源清晰,但对交易成本极端敏感;
  • 动量:更长周期上延续性占上风。动量与均值回归在不同时间尺度上共存,不矛盾——信号的符号取决于你看的横坐标

再加上量价形态、跨资产信息(期权、可转债、ETF 流量对个股的领先性)等统计型预测因子。原书态度:技术信号人人会做、拥挤而衰减快,但便宜、容量大、永远是 alpha 池的基础仓

统计学习基础:他为什么要绕道讲理论#

原书用相当篇幅讲信息论(互信息、熵)、贝叶斯推断、偏差-方差权衡、PAC 可学习性。这不是学究病,而是给出判断工具:

  • 偏差-方差权衡在低信噪比下几乎总是偏向”高偏差、低方差”一端——简单模型 + 强正则化;
  • 正则化等价于先验:ridge/lasso 不是调参技巧,是你对”系数应该多大”的信念表达;
  • 加权大数定律:样本不等权(新数据更相关、波动期方差更大),有效样本量远小于名义样本量——与《金融机器学习》的样本唯一性论证殊途同归。

ML 方法清单与金融特殊要求#

原书把主流方法过了一遍(正则化线性回归、KNN 与核平滑、决策树/随机森林/boosting、神经网络与深度学习、在线学习),但真正的贡献是列出金融预测对 ML 的特殊要求

要求原因
抗过拟合是第一优先级信噪比太低,模型会先学会噪声
处理非平稳市场机制变迁,老数据会”过期”
支持在线/滚动更新信号衰减,模型需要持续再训练
可解释、可归因亏钱时必须能回答”哪个特征干的”

在这套标准下他的结论很克制:正则化线性模型与 boosted trees 是工业主力,深度学习在中频股票预测上尚未证明系统性优势——数据量与信噪比撑不起那么多参数。

还有一条工程权衡值得单独记住——时效性与显著性的权衡:快信号(分钟级)统计显著性好验证但容量小、成本敏感;慢信号(月级)容量大但一辈子也攒不够独立样本去证明它显著。机构的解法是快慢搭配,让快信号养活研发、慢信号承载规模。

本页带走的三句话#

  1. 统计套利的预测 IC 只有百分之几,生意靠大数定律聚合,不靠单次预测准——一切 ML 取舍由此出发;
  2. 低信噪比把偏差-方差权衡推向简单一端:正则化线性 + boosted trees 是主力,深度学习不是银弹;
  3. 快信号好验证但容量小,慢信号有容量但难证显著——alpha 研发的第一个组合决策是快慢搭配。