策略参数的过拟合陷阱
上一章我们聊了策略监控和干预。在监控过程中,最诱人的冲动就是「调参数」——如果把均线周期从 20 改成 17,收益会不会更好?
这种冲动背后藏着量化策略最危险的陷阱:过拟合。这一章我们深入理解过拟合的本质,以及如何在实践中防范它。
一、过拟合的本质:记住了噪音
市场数据由两部分组成:信号(可重复的规律)和噪音(随机的波动)。
过拟合就是策略把噪音当成了信号——它完美地「解释」了历史数据,但对未来毫无预测能力。
类比:就像一个学生做历年真题,把所有答案都背下来了。在模拟考(历史数据)中得了满分,但换一套新题(未来数据)就不会了。
二、过拟合的五个识别信号
信号1:回测曲线过于完美
如果回测收益曲线几乎是直线上升,没有任何明显的回撤——大概率是过拟合了。真实的策略一定有波动和回撤。
信号2:参数非常「精确」
如果策略的关键参数是 17.3 或 23.7 这种精确到小数的数字,说明参数是通过反复优化得到的——过拟合风险极高。好的策略参数通常是整数或有逻辑含义的数字(如 20 日均线代表一个月的交易日)。
信号3:参数数量过多
参数越多,策略越容易「适配」历史数据中的随机模式。一个简单的双均线策略只有 2 个参数,一个复杂的 10 参数策略,过拟合风险远高于前者。
信号4:样本内外表现差异巨大
如果把数据分为「训练集」和「测试集」,策略在训练集上表现优异但在测试集上表现平平——这是过拟合的经典信号。
信号5:策略逻辑难以解释
如果你无法用简洁的语言解释「为什么这个参数是 17 而不是 20」,那这个参数很可能只是巧合地适配了历史数据。
三、防范过拟合的三种方法
方法1:保持策略简洁
参数越少、逻辑越清晰的策略,过拟合风险越低。42号概率实验室的策略追求「用最少的参数捕捉最本质的规律」。
方法2:样本外验证
将数据分为两段:前 70% 用于开发和优化策略(训练集),后 30% 用于验证策略(测试集)。如果策略在测试集上表现和训练集接近,过拟合风险较低。
方法3:Walk-forward 分析
将数据分成多个滚动窗口,在每个窗口上优化参数,然后在下一个窗口上验证。这种方法可以测试策略在不同时间段上的稳定性。
四、42号概率实验室的防过拟合实践
42号概率实验室在策略开发中严格遵循以下原则:
- 参数简洁性优先:宁可收益略低,也要保持参数数量少、有逻辑含义
- 样本外验证必做:每个策略上线前必须通过样本外验证
- 策略A v2.1 的真实案例:风控优化后止损次数从52次降至15次,但总收益仅降0.57%——这说明优化是针对真正的风险信号,而不是针对历史噪音
- 拒绝「完美曲线」:如果一个策略的回测曲线看起来太好看了,反而会触发警觉
本章要点
- 过拟合的本质:策略记住了噪音而非信号
- 五个识别信号:曲线过于完美、参数精确到小数、参数数量多、样本内外差异大、逻辑无法解释
- 三种防范方法:保持简洁、样本外验证、Walk-forward分析
- 42号概率实验室原则:参数简洁优先、样本外验证必做、拒绝完美曲线
思考题
- 一个策略有 8 个参数,回测年化收益 40%,你会怎么评估它的过拟合风险?
- 「样本外验证通过不代表未来一定有效」——为什么?还有哪些风险?
- 策略A v2.1 优化后收益仅降 0.57% 但止损次数降了 71%——你怎么理解这个结果?
现在你已经能读懂单个策略、监控策略健康度、防范过拟合。但如果你同时运行多个策略,如何让它们协同而非内耗?下一章进入多策略组合的世界。