08|时间序列数据质量与标准化验证
袁从德

你好,我是袁从德。
第 7 讲我们解决了“数据能不能复查”的问题,这节课我们将聚焦另一个问题:清洗如何防止错误数据被包装成可靠输入?缺失字段、乱序时间、重复时间戳和不可转换字符串,都必须被识别、记录和拦截,不能为了图表连续而静默补成正常值。
本讲的最终交付物是一份数据质量报告:说明字段转换规则、关键字段缺失处理、展示层 / 指标层 / 回测层的放行边界,以及污染样本验证结果。学完之后,你就能判断一份时间序列数据只是“能展示”,还是已经具备进入指标和回测的资格。
1. 数据清洗的目标与边界
初次清洗数据时,目标很容易被误解为“让表格没有空值、图表能画出来、模型能读进去”。量化研究中的清洗,不以视觉连续为目标,而以输入可解释为目标。
举个例子,假设一条资金数据缺少 netInflow24h。如果展示端为了连续呈现,把缺失值自动填成 0,图表确实不会断,但会让人以为“资金净流入为 0”。真实含义可能是“上游没有返回该字段”。0 是事实,缺失是未知,二者不能互换。
因此,本讲采用一个基本原则:能解释的转换才做,不能解释的缺口记录为缺失。
src/dashboard/normalize.py 中的 _to_float 就体现了这个原则。它尝试把基础字符串数值转成浮点数,如果遇到空值、类型错误或不可转换字符串,就返回 None。代码 8-1 给出这个最小转换函数。
公开
同步至部落
取消
完成
0/2000
笔记
复制
AI
- 深入了解
- 翻译
- 解释
- 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《Codex 与 LLM 量化交易实战课》,新⼈⾸单¥59
《Codex 与 LLM 量化交易实战课》,新⼈⾸单¥59
立即购买
© 版权归极客邦科技所有,未经许可不得传播售卖。 页面已增加防盗追踪,如有侵权极客邦将依法追究其法律责任。
登录 后留言
精选留言
由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论