948 字
5 分钟
收益预测:从线性回归到深度网络与另类数据
综述第 3 章(Return Prediction),全文篇幅最大、结论最扎实的部分:把十年来”用 ML 预测股票收益”的文献按方法谱系排成一列。本页来自 Kelly–Xiu 免费综述(SSRN 4501707)的精读,重点是给每类方法一个结论 + 一篇代表作。
方法谱系:一条从简到繁的线
综述把收益预测方法排成谱系,每一档都回答”比上一档多赚了什么”:
| 方法档位 | 核心思想 | 代表论文 |
|---|---|---|
| 简单线性 | 少数变量 OLS,基准线 | Welch & Goyal(2008,泼冷水经典)、Lewellen(2015) |
| 惩罚线性 | Lasso/Ridge/弹性网,吃下几百个特征 | Rapach, Strauss & Zhou(2013)、Chinco 等(2019) |
| 降维 | PCA 回归、PLS、三步回归滤波 | Kelly & Pruitt(2013, 3PRF)、Light 等(2017) |
| 树模型 | 自动捕捉非线性与交互 | 随机森林 / GBRT,Moritz & Zimmermann(2016) |
| 神经网络 | 通用逼近,浅层往往够用 | Gu, Kelly & Xiu(RFS 2020) |
锚点论文:GKX 2020
《Empirical Asset Pricing via Machine Learning》是全领域的基准实验:美股全市场约 3 万只股票 × 94 个公司特征 × 60 年,统一比较十余种模型。核心结论:
- 非线性有真金白银:树模型和浅层神经网络稳定优于所有线性方法,个股月度样本外 R² 从约 0.3% 提到 0.4%(别嫌小——横截面上这点差距对应组合层面夏普接近翻倍);
- 重要特征高度集中:动量类、流动性类、波动率类特征贡献了大部分预测力——ML 没有发明新异象,而是更聪明地组合了已知信息;
- 深度不是越深越好:三层左右的浅网络最优,更深反而变差——金融数据的信噪比养不起真正的深度。
各国复现基本支持上述排序。对 A 股用户特别相关的一篇:Leippold, Wang & Zhou(JFE 2022)《Machine learning in the Chinese stock market》——在 A 股复现 GKX 框架,发现流动性与波动率类特征比在美股更重要,且散户占比高使得短期可预测性更强。
实验设计的规矩(3.2 节,实践含金量最高)
滚动/扩张窗口训练、验证集调参、严格样本外评估;用横截面相对预测而非绝对水平预测;评估用组合分层收益而不只是 R²。这套规矩就是本平台 IC 分析 + 分层回测流程的学术版。
另类数据(3.10 节):文本与图像
- 文本:Ke, Kelly & Xiu《Predicting Returns with Text Data》提出 SESTM——用监督学习从新闻里筛选情绪词并给文章打分,纯文本信号在美股有显著短期预测力且随新闻新鲜度衰减。这一支的方法演进:词典法 → 词频监督学习 → 词向量 → 大语言模型;
- 图像:Jiang, Kelly & Xiu《(Re-)Imag(in)ing Price Trends》(JF 2023)把 K 线图当图片喂给 CNN,学出的信号类似”更聪明的动量/反转”,且跨市场迁移能力强——证明价格形态里确有可学的结构;
- 综述的态度:另类数据是增量信息的最可靠来源,但处理成本高、生命周期短,工程能力本身就是壁垒。
带走的三句话
- 十年文献一句话:非线性和大特征集有真实增量,但赢家是浅网络和树模型,不是越深越好——金融的信噪比养不起真深度;
- ML 预测器的收益来源高度集中在动量、流动性、波动率三类特征——先把这三类因子在本平台做扎实,就是在复现文献主干;
- 深挖清单:方法看 GKX 2020,A 股看 Leippold 等 2022,文本看 SESTM,图像看 CNN 读图——四篇构成这一章的骨架。