第 4~6、11、17 章:想法怎么变成表达式
对应原书 Part II 的设计工序:《Alpha Design》《How to Develop an Alpha: A Case Study》《Data and Alpha Design》《The Triple-Axis Plan》《Thinking in Algorithms》。这几章合起来回答一个问题:从模糊的想法到能进回测的表达式,中间有哪些标准动作。
设计五要素(第 4 章)
Bender 与 He 把一个 alpha 的设计拆成五个决策:用什么数据、覆盖什么股票池、预测什么区间、表达式怎么写、怎么做标准化处理。每一项都是显式选择,不是默认值。对照本平台:数据 = 量价面板,股票池 = 全 A 或抽样,预测区间 = --period 参数,表达式 = 注册的因子函数——你每次跑因子分析,其实都在填这张五要素表。
第 4 章还强调收尾工序:去极值、中性化(行业/市值)、平滑——原始表达式只是毛坯,后处理才让它能用。这是本平台目前最欠缺的一环(截面 rank 之外没有行业中性化),读这章能明白代价是什么:你的因子 IC 里可能混着行业贝塔。
一个 alpha 的诞生(第 5 章)
案例章用”分析师情绪”因子走完全流程:想法(分析师上调评级的股票短期跑赢)→ 找数据 → 写成表达式 → 回测 → 发现换手过高 → 加衰减平滑 → 复测达标。中间的失败与修补是全书最诚实的段落——第一版表达式几乎从不达标,设计是一个迭代循环,与量化学堂案例三”写因子 → 检验 → 改进”的节奏完全一致。
数据是第一生产力(第 6 章)
Li 的判断很直白:新数据源带来的 alpha,通常比在旧数据上换花样更多。量价数据人人都有,拥挤最快;财报次之;另类数据(新闻、供应链、卫星图)竞争最少但清洗成本最高。章内给了数据验收清单:历史够不够长、有没有幸存者偏差、时间戳是否可信(point-in-time)、未来会不会持续可得。这张清单直接适用于你给平台接入任何新数据源之前的自查。
三轴计划 TAP(第 11 章,第 2 版新增)
Maini 的 Triple-Axis Plan 是流水线的”产能规划工具”:把 alpha 空间按三根轴展开——想法/数据集 × 表现参数 × 地区/股票池。已有的好 alpha 不该只是一个点,而应沿轴批量泛化:同一个反转想法,可以换周期(5 日 → 20 日)、换池子(全 A → 沪深 300)、换数据(收盘价 → 成交量加权价)。一个想法 × 三根轴 = 一族 alpha。你在因子对比页看到的 reversal_5 与 momentum_20,就是同一轴系上的两个点。
警惕:TAP 也是过拟合放大器——沿轴生成 50 个变体再挑最好的,等于做了 50 次多重检验。下一页的验收工序必须跟上。
像算法一样思考(第 17 章)
Mahajan 谈研究品味:好表达式偏爱单调、平滑、少参数——排序(rank)优于原始值,连续衰减优于硬阈值,三个参数以内优于十个。参数越多、非线性越花哨,表达式记住噪声的容量越大。这是写因子函数时最实用的一页纸审美。
对照本平台的内置因子正好自查一遍:reversal_5 只有一个周期参数、输出天然可 rank,是这套审美的及格样本;反例则是那种叠了五层条件判断、七个魔法数字的”缝合因子”——回测再好也先怀疑。
带走的三句话
- 设计是填表不是灵感:数据、股票池、区间、表达式、后处理,五个决策每项都要显式选择;
- 新数据源胜过旧数据上的新花样,但接入前先过验收清单——point-in-time 最容易被忽视;
- TAP 让一个想法变一族因子,但每次泛化都是一次多重检验——产能和验收必须配套扩张。