919 字
5 分钟

第 15~16 章:alpha 工厂——自动挖掘与机器学习

对应原书《Alphas from Automated Search》与《Machine Learning in Alpha Research》(后者为第 2 版新增)。这两章是”工厂”一词的字面兑现:连想法环节也自动化,机器直接生成候选表达式。

自动搜索:让机器写表达式(第 15 章)#

Huang 与 Intaraprasonk 描述的系统是全书最激进的工序:定义一组算子(rank、delay、correlation、decay……)和一组原料(价、量、财务字段),让程序组合枚举出海量候选表达式,统一回测,按 IC/IR/相关性自动筛选。世坤公开论文《101 Formulaic Alphas》里那些 rank(ts_argmax(signed_power(...))) 式的怪异公式,就是这条产线的样品。

两章的自辩与自警都值得记录:

  • 自辩:人类研究员的想法枯竭得比 alpha 衰减还快,自动搜索是产能问题的唯一解;机器不带叙事偏见,能找到人类不会讲故事的信号;
  • 自警:枚举一亿个表达式,纯噪声也会送来几千个”高 IC”——自动搜索的多重检验问题比人工研究严重几个数量级。书中的对策是提高验收门槛:更长样本外、更严相关性去重、要求信号族整体有效而非单点有效。

诚实地说,这章对”怎么把门槛定量”语焉不详——这正是《金融机器学习》里 Deflated Sharpe/PBO 要补的课,两本书在此接榫。

机器学习:工具而非魔法(第 16 章)#

Kozlov 的定位相当克制(与市面上的 ML 炒作形成反差):金融数据信噪比太低、样本太少,深度模型直接预测收益率的性价比很差;ML 在世坤产线上更常见的岗位是配角——

  • 特征组合器:把几百个已验收的 alpha 非线性组合成 mega-alpha(GBDT 类最常用);
  • 信号过滤器:判断某个 alpha 在什么市况下该信、该降权(类似元标签思想);
  • 数据加工器:从新闻文本、另类数据里提取结构化特征,再交给传统表达式。

结论一句话:ML 改变的是工序效率,不是验收标准——无论信号出自人脑、枚举器还是神经网络,IC/IR/相关性/样本外那关一视同仁。

工厂模式的中国分厂#

这套”海量研究员 + 标准化回测 + 相关性去重 + 信号组合”的模式,被世坤系创业者原样搬回 A 股:九坤(王琛、姚齐聪均出自世坤)是最彻底的复制者,灵均马志宇曾任世坤中国区研究总监(均见量化名人堂)。A 股散户占比高、低效更多,流水线的单位产出一度远高于美股——2021 年后超额普遍衰减,则是”alpha 是消耗品”的集体验证。

对本平台的启示#

个人研究者学工厂,学的是流程而不是规模:因子注册中心(research/factors.py)是你的表达式库,因子对比页是你的验收车间,量化学堂案例三是你的上岗培训。真要试自动搜索,从小算子集开始(rank/delay/diff × 价量),并把样本外门槛调到比手工因子更严——枚举越多,折扣越狠。

带走的三句话#

  1. 自动搜索解决产能,但多重检验问题同步放大——枚举规模越大,验收折扣必须越狠;
  2. ML 在成熟产线上是配角:组合信号、过滤信号、加工数据,而不是端到端预测价格;
  3. 工具再先进,验收标准不变:样本外 IC/IR、低相关、费后为正,三关全过才算 alpha。