1002 字
5 分钟
第一部分:数据与 alpha 因子工程(第 1~5 章)
原书第一部分回答”喂给模型什么”:市场数据、基本面数据、另类数据,以及把原始数据加工成 alpha 因子的完整套路。第 4 章是全书对本平台价值最高的一章,本页把重心压在那里。
第 1 章:全书工作流(先看懂这张图)
从想法到执行的流水线:数据 → 特征(alpha 因子)→ 模型 → 组合 → 执行,ML 可以插进其中任何一环,但最常见、性价比最高的位置是特征之后、组合之前——用模型把一堆弱因子合成一个强信号。对照本平台:ingest 是数据层,research/factors.py 是特征层,回测引擎是组合层——平台目前的因子直接排序选股,等于”没有模型层”的特例,这本书教的就是怎么把模型层补上。
第 2~3 章:数据从哪来(索引章,翻过即可)
- 第 2 章 市场与基本面数据:tick 数据怎么聚合成 bar、订单簿(Nasdaq ITCH)怎么重建、基本面数据(SEC EDGAR/XBRL)怎么解析。美股管道细节对 A 股用户是索引材料——AKShare 已经替你干了脏活,但”bar 是对 tick 的有损压缩”这个观念值得带走;
- 第 3 章 另类数据:卫星图像、信用卡流水、网络爬虫。真正可迁移的是四维评估框架——信号含量(能否预测收益)、独家性(多少人已在用)、数据质量(历史长度/缺失/作弊)、法律与成本。以后任何人向你兜售”另类数据”,用这四个维度过一遍。
第 4 章:alpha 因子工程(必精读)
这是全书的心脏,讲”怎么把数据变成候选因子”的完整套路:
- 因子从哪来:动量、价值、波动率、质量、流动性五大家族,每族给出经济逻辑(谁在送钱)——和《因子投资》的谱系完全接得上;
- 原料加工:用 pandas/NumPy 向量化计算;TA-Lib 的百余个技术指标不是秘籍,是现成的特征原料库;卡尔曼滤波、小波去噪做平滑——降噪后的动量常比裸动量干净;
- 因子体检:用 alphalens 做 IC 分析、分位数收益、换手率衰减——本平台的因子分析页就是 alphalens 思路的自实现(IC/RankIC/分层回测),读这节等于读平台
research/analysis.py的设计文档; - 附录 Alpha Factor Library:收录 101 Alphas 等公式化因子——当原料清单用,别当圣经拜(多重检验的达摩克利斯之剑悬在每一条上面)。
对平台的直接启发:写新因子时按”经济逻辑 → pandas 实现 → IC 体检”三步走,第 7 页的动手练习就按这个套路设计。
第 5 章:组合优化与业绩评估(选读)
均值方差、Kelly 公式、风险平价到分层风险平价(HRP)的谱系,加 pyfolio 的业绩报告(tear sheet)。本平台回测用 top-N 等权,是这条谱系上最朴素但最不易过拟合的一档——等权的最大优点是没有参数可以拟合。业绩评估部分(夏普、最大回撤、换手)与平台回测报告一一对应。
动手:翻开
src/alphaforge/research/factors.py里任意一个已注册因子,按第 4 章三步反向拆解——它的经济逻辑是什么、实现用了 pandas 哪几板斧、IC 体检报告在因子分析页长什么样。拆过一个,再写新的就顺手了。
本页带走的三句话
- ML 最顺手的插入点是特征之后、组合之前:把一堆弱因子合成一个强信号;
- 第 4 章的三步套路——经济逻辑、向量化实现、IC 体检——就是平台写因子的标准作业程序;
- 技术指标和 101 Alphas 是特征原料库,不是秘籍;另类数据用四维框架评估。