917 字
5 分钟
工具箱篇:过拟合是头号敌人(第 3~4 章)
本页覆盖第二部分”工具箱”:第 3 章讲拟合(回测怎么不骗自己),第 4 章讲组合配置(权重怎么定)。这两样工具后面整个框架都要反复用。
第 3 章:拟合(Fitting)——回测的黄金法则
回测最大的危险不是算错,而是过拟合:参数越多、尝试的组合越多,你拟合的就越是历史噪音而非规律。回测夏普 2.0 的策略实盘变 0,多数就死在这。
作者给出贯穿全书的黄金法则:任何规则和参数的选择,只能使用”决策当时可以拿到”的数据——检验必须是样本外的(扩展窗口或滚动窗口),绝不允许用全部历史调好参数、再用同一段历史打分。偷看未来一次,回测就作废一次。
三种拟合姿势,作者态度分明:
| 姿势 | 做法 | 作者评价 |
|---|---|---|
| 不拟合 | 用先验常识定参数(如等权、经典均线组合) | 最稳,多数人的最优解 |
| 谨慎拟合 | 样本外 + 自助法(bootstrap),只做温和调整 | 作者推荐的上限 |
| 理想化拟合 | 全样本反复调参挑最优 | 自欺,回测幻觉制造机 |
两条实操检查:规则要少而简单(每条规则有经济逻辑,变体数量克制);参数要连续(相邻参数表现应当相近——5 日均线赚钱而 4 日、6 日亏钱的”规律”是噪音)。
第 4 章:组合配置——优化器是误差放大器
拿到一组策略或资产,权重怎么定?教科书答案是均值-方差优化,作者的答案是:别直接用。优化器对输入极度敏感——预期收益差之毫厘,权重谬以千里,经常输出”全仓某一个、清空其他”的极端解。
三种解药,从工程到手艺:
- 自助法(bootstrapping):反复抽样历史数据做多次优化,取平均权重,抹平输入噪音;
- 收缩(shrinkage):把估计值向保守先验拉回;
- 手工配置(handcrafting):作者的招牌方法,不需要跑优化器——
- 所有资产先按波动率归一(比较的是风险调整后收益);
- 默认假设各资产夏普相等(除非有极强证据,否则别自信能预测谁更好);
- 按相关性把资产分组(相关高的算”一伙”);
- 组内近似等权,组间按查表权重分配。
等权重就是 handcrafting 在”信息最少”时的特例——当你无法可靠估计预期收益时,等权不是偷懒,是诚实。
对应本平台
- 平台回测的 top-N 等权组合,正是第 4 章”无收益预测时等权最诚实”的实践——这不是简化,是及格线;
- 黄金法则自测:
factor analyze时把样本切成前后两半,前半段选出的因子参数,后半段还站得住吗? - 参数连续性实验:
reversal_5改成 4 日、6 日各算一次 IC——三者应该同量级,若只有 5 日显著,警惕噪音。
本章带走的三句话
- 黄金法则:规则与参数的选择只能用”当时可得”的数据,检验必须样本外,偷看未来一次回测作废一次;
- 拟合姿势宁低勿高:不拟合最稳,谨慎的样本外拟合是上限,全样本调参是自欺;
- 优化器是误差放大器;handcrafting 用”等夏普假设 + 相关性分组”给出稳健权重,等权是它诚实的特例。