15|用样本和评分规程验证 LLM 信号
袁从德

你好,我是袁从德。
第 14 讲我们把污染样本挡在回测前,这节课继续回答另一个问题:一条没有触发污染门禁的 LLM 信号,是否就可以进入策略研究?答案仍然是否定的。结构合法、没有关键污染,只说明这条信号具备被评估的资格。它是否稳定、是否引用证据、是否承认缺失、是否能在相似样本上保持一致,还需要用固定样本和评分规程来验证。
模型信号验证不是“挑一条优质回答展示给你”。单次优质回答,只能说明模型在某一次输入上表现尚可,不能说明它在固定样本上可复测。真正有价值的验证,必须先固定样本,再固定评分规程,然后让 Codex 执行评分、列出关键失败、比较提示词或模型版本,并把人工决定写进交付记录。
本讲的交付物是一份 LLM 信号评分规程。它至少包括样本版本、样本类型、评分字段、权重、关键失败定义、版本比较表、测试命令和人工复核结论。Codex 的职责是把评分规程变成可运行检查;研究者的职责是决定样本是否足够代表业务场景,以及是否允许某个版本继续进入后续因子评估、策略规则和回测。
1. 固定样本与关键失败
我们先从两条样本进入,再扩展到样本集设计。这样安排是为了先把“关键失败优先于平均分”的判断立住,再说明为什么样本必须提前固定,不能在看到模型输出之后再挑选。
公开
同步至部落
取消
完成
0/2000
笔记
复制
AI
- 深入了解
- 翻译
- 解释
- 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《Codex 与 LLM 量化交易实战课》,新⼈⾸单¥59
《Codex 与 LLM 量化交易实战课》,新⼈⾸单¥59
立即购买
© 版权归极客邦科技所有,未经许可不得传播售卖。 页面已增加防盗追踪,如有侵权极客邦将依法追究其法律责任。
登录 后留言
精选留言
由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论