FDE 业务落地实战
曹犟
FDE 前沿践行者,神策数据联合创始人 & CTO
2262 人已学习
新⼈⾸单¥59
登录后,你可以任选4讲全文学习
课程目录
已更新 12 讲/共 26 讲
FDE 业务落地实战
15
15
1.0x
00:00/00:00
登录|注册

11|评估驱动开发:AI 项目到底怎么定义“好”、怎么验收?

你好,我是曹犟。
上一讲的结尾我们留了一个问题:AI 系统到底好不好,究竟该谁说了算?
我们先看一个你大概率经历过的场景。一个项目做到后期,客户说“这个 AI 感觉不太准”,你说“我们内部测试过,没问题”。两边都没说谎,但也都说服不了对方,因为从头到尾,双方用的就不是同一把尺子。项目越到后期,这种争执就越伤感情,也越伤项目。更麻烦的是它带来的连锁反应:因为说不清改动是变好还是变坏,每次升级都要靠人肉把主要场景重测一遍,到最后,谁都不敢动 Prompt,系统就在“不敢动”里慢慢烂掉。
第 6 讲我们曾经讲过,尺子要在开工前就定好。但那一讲定的是业务层面的尺子:北极星指标、基线、归因等。这一讲要解决的是另一层的标准:系统层面的“好”。模型回答得准不准、稳不稳定、会不会胡说八道,这一层没法直接用 GMV 等最终业务指标来衡量,却恰恰是验收时最要紧的一关。开篇词里我曾说过一句话:AI 负责做出来,人负责判断是否做得好。这一讲要做的,就是把后半句从模糊的感觉变成实际的工程。
还有一个数字需要再次提一下,第 3 讲提过 IDC 的一个统计,说 88% 的 AI 概念验证项目从未走到生产。引用这个数字的 Vaughan 还给了一个归因:败因多数不在模型不够强,而在 Harness 从来没有搭起来。Harness 是什么,这一讲也会说清楚。
确认放弃笔记?
放弃后所记笔记将不保留。
新功能上线,你的历史笔记已初始化为私密笔记,是否一键批量公开?
批量公开的笔记不会为你同步至部落
公开
同步至部落
取消
完成
0/2000
荧光笔
直线
曲线
笔记
复制
AI
  • 深入了解
  • 翻译
    • 英语
    • 中文简体
    • 法语
    • 德语
    • 日语
    • 韩语
    • 俄语
    • 西班牙语
  • 解释
  • 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《FDE 业务落地实战》
新⼈⾸单¥59
立即购买
登录 后留言

精选留言

由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论
显示
设置
留言
收藏
沉浸
阅读
分享
手机端
快捷键
回顶部
文章页面操作
MAC
windows
作用
esc
esc
退出沉浸式阅读
shift + f
f11
进入/退出沉浸式
command + ⬆️
home
滚动到页面顶部
command + ⬇️
end
滚动到页面底部
⬅️ (仅针对订阅)
⬅️ (仅针对订阅)
上一篇
➡️ (仅针对订阅)
➡️ (仅针对订阅)
下一篇
command + j
page up
向下滚动一屏
command + k
page down
向上滚动一屏
p
p
音频播放/暂停
j
j
向下滚动一点
k
k
向上滚动一点
空格
空格
向下滚动一屏
播放器操作
MAC
windows
作用
esc
esc
退出全屏
⬅️
⬅️
快退
➡️
➡️
快进
空格
空格
视频播放/暂停(视频全屏时生效)