955 字
5 分钟

第一道工序:市场数据与预测数据源

对应原书第 1 章(Market Data)与第 2 章开篇的数据源部分。原书无中译;本页为原创导读笔记,只给地图不做推导。

第 1 章:市场数据——短,但每条都踩过坑#

这是全书最短的一章,讲的都是”入行第一个月必然踩、之后每年还会再踩”的事:

  • Tick 与 bar 数据:tick 是原始事件流,bar 是聚合视图。中频统计套利大多用日线或分钟 bar 就够——数据颗粒度应该匹配持仓周期,而不是越细越好(越细越贵、越脏、越难存);
  • 公司行为与复权因子:拆股、分红、增发会让原始价格序列出现”假跳空”。解法是维护一列复权因子,存原始价、算的时候再乘因子——这正是本平台 adjust_factor 表的设计(hfq_factor = 后复权价 / 原始价,读取时相乘)。Isichenko 强调复权因子本身要有审计与重刷机制,因为数据商会回溯修正;
  • 线性收益 vs 对数收益:对数收益跨期可加、便于统计建模;线性收益跨截面可加、才是组合真实的钱。日频上两者差异是二阶小量,但做组合聚合时必须用线性收益,混用是新手常见 bug。

一句话:这一章没有智力难度,只有纪律难度——数据层的错误会以”看起来像 alpha”的形式出现,比模型错误危险得多。

第 2 章开篇:预测数据源的分类学#

收益预测是全书公认最难也最值钱的环节,而预测始于数据。原书把可用数据源过了一遍,像一份”军火目录”:

数据源典型信号关键坑
量价(技术)均值回归、动量、量价形态拥挤、衰减快
财务与会计数据价值、质量、盈利修正发布滞后、口径重述
分析师预期预期修正、超预期覆盖偏差、羊群
持仓与资金流13F 跟随、申赎压力披露滞后、低频
新闻与社交媒体事件驱动、情绪结构化过程引入别人的偏差
另类数据卫星图、刷卡数据、供应链贵、历史短、易失效
Alpha capture卖方/外部信号采购逆向选择——好的不卖你

两条贯穿所有数据源的纪律#

  1. Point-in-time(信息何时可知):财报必须按发布日对齐而非报告期;分析师预期要用当时的快照而非事后修订版。任何”用了未来才知道的数据”都会在回测里制造幻觉 alpha——这是《金融机器学习》前视偏差的同一课,在数据采购环节就要防;
  2. 证券主表与幸存者偏差:股票池必须包含退市、更名、被并购的证券的完整历史。只用”今天还活着的股票”回测,等于系统性高估策略——尤其是做空腿和小盘票。

原书的冷静判断值得记录:另类数据听起来性感,但信号强度通常不比传统数据高,只是相关性低——它的价值在于给 alpha 池添加低相关成员(第 3 章的主题),而不是单独致富。

本页带走的三句话#

  1. 数据层没有智力难度只有纪律难度:复权、口径、线性 vs 对数收益,错在这里的 bug 都伪装成 alpha;
  2. 每个数据源进门先问两句——信息何时可知(point-in-time)、死掉的证券在不在(幸存者偏差);
  3. 另类数据的真实价值是”低相关”而非”更强”:它是 alpha 池的分散化配料,不是独门武器。