11|评估驱动开发:AI 项目到底怎么定义“好”、怎么验收?
曹犟

你好,我是曹犟。
上一讲的结尾我们留了一个问题:AI 系统到底好不好,究竟该谁说了算?
我们先看一个你大概率经历过的场景。一个项目做到后期,客户说“这个 AI 感觉不太准”,你说“我们内部测试过,没问题”。两边都没说谎,但也都说服不了对方,因为从头到尾,双方用的就不是同一把尺子。项目越到后期,这种争执就越伤感情,也越伤项目。更麻烦的是它带来的连锁反应:因为说不清改动是变好还是变坏,每次升级都要靠人肉把主要场景重测一遍,到最后,谁都不敢动 Prompt,系统就在“不敢动”里慢慢烂掉。
第 6 讲我们曾经讲过,尺子要在开工前就定好。但那一讲定的是业务层面的尺子:北极星指标、基线、归因等。这一讲要解决的是另一层的标准:系统层面的“好”。模型回答得准不准、稳不稳定、会不会胡说八道,这一层没法直接用 GMV 等最终业务指标来衡量,却恰恰是验收时最要紧的一关。开篇词里我曾说过一句话:AI 负责做出来,人负责判断是否做得好。这一讲要做的,就是把后半句从模糊的感觉变成实际的工程。
还有一个数字需要再次提一下,第 3 讲提过 IDC 的一个统计,说 88% 的 AI 概念验证项目从未走到生产。引用这个数字的 Vaughan 还给了一个归因:败因多数不在模型不够强,而在 Harness 从来没有搭起来。Harness 是什么,这一讲也会说清楚。
公开
同步至部落
取消
完成
0/2000
笔记
复制
AI
- 深入了解
- 翻译
- 解释
- 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《FDE 业务落地实战》,新⼈⾸单¥59
《FDE 业务落地实战》,新⼈⾸单¥59
立即购买
© 版权归极客邦科技所有,未经许可不得传播售卖。 页面已增加防盗追踪,如有侵权极客邦将依法追究其法律责任。
登录 后留言
精选留言
由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论