20|防止过拟合、前视偏差与数据窥探
袁从德

你好,我是袁从德。
第 19 讲我们解释了收益、回撤、Sharpe、Calmar、PSR 和 DSR。这节课把问题往前推一步:这些绩效是不是干净的?如果研究过程被污染,再漂亮的指标也不能直接作为策略证据。很多回测问题不是算错了指标,而是指标从一开始就站在不干净的样本上。策略可能反复调参才碰巧命中,也可能在特征里偷看了未来,还可能把失败版本全部藏起来。看到一条漂亮曲线时,第一反应不该是“策略有效”,而该是“它经历过哪些污染检查”。
所以本讲不从“怎么把回测跑起来”开始,而是先问一个更靠前的问题:这条回测曲线有没有资格被解释?最终交付物也不是一句“没有作弊”,而是一份污染审计记录:污染类型、触发证据、拦截层级、处理决定和剩余风险都要写清楚。Codex 在这里的价值,是把污染风险从口头规范变成可复核动作。
等共同语言建立后,我们再进入可运行样本:用安全门拦危险代码,用前视门拦未来信息,用试验日志记录失败尝试,再用 PBO 思路检查样本内冠军是否到了样本外就掉队。这样你就会明白为什么要查,再看代码怎样查。
1. 三类污染与审计契约
这里我们先建立共同语言。过拟合、前视偏差和数据窥探经常一起出现,但它们破坏的证据不同,处理方式也不同。只有把污染路径说清楚,后面的代码门禁、试验日志和 PBO 审计,才不会变成零散检查项。
公开
同步至部落
取消
完成
0/2000
笔记
复制
AI
- 深入了解
- 翻译
- 解释
- 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《Codex 与 LLM 量化交易实战课》,新⼈⾸单¥59
《Codex 与 LLM 量化交易实战课》,新⼈⾸单¥59
立即购买
© 版权归极客邦科技所有,未经许可不得传播售卖。 页面已增加防盗追踪,如有侵权极客邦将依法追究其法律责任。
登录 后留言
精选留言
由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论