948 字
5 分钟

收益预测:从线性回归到深度网络与另类数据

综述第 3 章(Return Prediction),全文篇幅最大、结论最扎实的部分:把十年来”用 ML 预测股票收益”的文献按方法谱系排成一列。本页来自 Kelly–Xiu 免费综述(SSRN 4501707)的精读,重点是给每类方法一个结论 + 一篇代表作。

方法谱系:一条从简到繁的线#

综述把收益预测方法排成谱系,每一档都回答”比上一档多赚了什么”:

方法档位核心思想代表论文
简单线性少数变量 OLS,基准线Welch & Goyal(2008,泼冷水经典)、Lewellen(2015)
惩罚线性Lasso/Ridge/弹性网,吃下几百个特征Rapach, Strauss & Zhou(2013)、Chinco 等(2019)
降维PCA 回归、PLS、三步回归滤波Kelly & Pruitt(2013, 3PRF)、Light 等(2017)
树模型自动捕捉非线性与交互随机森林 / GBRT,Moritz & Zimmermann(2016)
神经网络通用逼近,浅层往往够用Gu, Kelly & Xiu(RFS 2020)

锚点论文:GKX 2020#

《Empirical Asset Pricing via Machine Learning》是全领域的基准实验:美股全市场约 3 万只股票 × 94 个公司特征 × 60 年,统一比较十余种模型。核心结论:

  1. 非线性有真金白银:树模型和浅层神经网络稳定优于所有线性方法,个股月度样本外 R² 从约 0.3% 提到 0.4%(别嫌小——横截面上这点差距对应组合层面夏普接近翻倍);
  2. 重要特征高度集中:动量类、流动性类、波动率类特征贡献了大部分预测力——ML 没有发明新异象,而是更聪明地组合了已知信息;
  3. 深度不是越深越好:三层左右的浅网络最优,更深反而变差——金融数据的信噪比养不起真正的深度。

各国复现基本支持上述排序。对 A 股用户特别相关的一篇:Leippold, Wang & Zhou(JFE 2022)《Machine learning in the Chinese stock market》——在 A 股复现 GKX 框架,发现流动性与波动率类特征比在美股更重要,且散户占比高使得短期可预测性更强

实验设计的规矩(3.2 节,实践含金量最高)#

滚动/扩张窗口训练、验证集调参、严格样本外评估;用横截面相对预测而非绝对水平预测;评估用组合分层收益而不只是 R²。这套规矩就是本平台 IC 分析 + 分层回测流程的学术版。

另类数据(3.10 节):文本与图像#

  • 文本:Ke, Kelly & Xiu《Predicting Returns with Text Data》提出 SESTM——用监督学习从新闻里筛选情绪词并给文章打分,纯文本信号在美股有显著短期预测力且随新闻新鲜度衰减。这一支的方法演进:词典法 → 词频监督学习 → 词向量 → 大语言模型;
  • 图像:Jiang, Kelly & Xiu《(Re-)Imag(in)ing Price Trends》(JF 2023)把 K 线图当图片喂给 CNN,学出的信号类似”更聪明的动量/反转”,且跨市场迁移能力强——证明价格形态里确有可学的结构;
  • 综述的态度:另类数据是增量信息的最可靠来源,但处理成本高、生命周期短,工程能力本身就是壁垒。

带走的三句话#

  1. 十年文献一句话:非线性和大特征集有真实增量,但赢家是浅网络和树模型,不是越深越好——金融的信噪比养不起真深度;
  2. ML 预测器的收益来源高度集中在动量、流动性、波动率三类特征——先把这三类因子在本平台做扎实,就是在复现文献主干;
  3. 深挖清单:方法看 GKX 2020,A 股看 Leippold 等 2022,文本看 SESTM,图像看 CNN 读图——四篇构成这一章的骨架。