Codex 与 LLM 量化交易实战课
袁从德
AI 创业公司 CTO,某交易所的前算法负责人
1093 人已学习
新⼈⾸单¥59
Codex 与 LLM 量化交易实战课
15
15
1.0x
00:00/00:00
登录|注册

08|时间序列数据质量与标准化验证

你好,我是袁从德。
第 7 讲我们解决了“数据能不能复查”的问题,这节课我们将聚焦另一个问题:清洗如何防止错误数据被包装成可靠输入?缺失字段、乱序时间、重复时间戳和不可转换字符串,都必须被识别、记录和拦截,不能为了图表连续而静默补成正常值。
本讲的最终交付物是一份数据质量报告:说明字段转换规则、关键字段缺失处理、展示层 / 指标层 / 回测层的放行边界,以及污染样本验证结果。学完之后,你就能判断一份时间序列数据只是“能展示”,还是已经具备进入指标和回测的资格。

1. 数据清洗的目标与边界

初次清洗数据时,目标很容易被误解为“让表格没有空值、图表能画出来、模型能读进去”。量化研究中的清洗,不以视觉连续为目标,而以输入可解释为目标。
举个例子,假设一条资金数据缺少 netInflow24h。如果展示端为了连续呈现,把缺失值自动填成 0,图表确实不会断,但会让人以为“资金净流入为 0”。真实含义可能是“上游没有返回该字段”。0 是事实,缺失是未知,二者不能互换。
因此,本讲采用一个基本原则:能解释的转换才做,不能解释的缺口记录为缺失。
src/dashboard/normalize.py 中的 _to_float 就体现了这个原则。它尝试把基础字符串数值转成浮点数,如果遇到空值、类型错误或不可转换字符串,就返回 None。代码 8-1 给出这个最小转换函数。
确认放弃笔记?
放弃后所记笔记将不保留。
新功能上线,你的历史笔记已初始化为私密笔记,是否一键批量公开?
批量公开的笔记不会为你同步至部落
公开
同步至部落
取消
完成
0/2000
荧光笔
直线
曲线
笔记
复制
AI
  • 深入了解
  • 翻译
    • 英语
    • 中文简体
    • 法语
    • 德语
    • 日语
    • 韩语
    • 俄语
    • 西班牙语
  • 解释
  • 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《Codex 与 LLM 量化交易实战课》
新⼈⾸单¥59
立即购买
登录 后留言

精选留言

由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论
显示
设置
留言
收藏
沉浸
阅读
分享
手机端
快捷键
回顶部