AI Agent 系统设计面试现场
邓明
前大厂资深专家,AI 领域连续创业者
3423 人已学习
新⼈⾸单¥59
登录后,你可以任选4讲全文学习
课程目录
已更新 27 讲/共 28 讲
第五章:Agent 评估和反馈 (1讲)
AI Agent 系统设计面试现场
15
15
1.0x
00:00/00:00
登录|注册

23|你怎么知道用户喜不喜欢你的 Agent?

你好,我是大明。
前面我们已经讨论了意图识别、Plan、Replan、上下文管理、RAG 等一大堆 Agent 机制。到这里,有一个问题无论如何都绕不过去:你做了这么多优化,怎么知道 Agent 真的变好了?
比如说你把意图识别改成三层机制,怎么证明准确率提高了?给 RAG 加了混合检索、Rerank、迭代式检索,怎么知道用户体验更好了?又或者你做了用户画像、动态上下文,用户真的买账吗?
如果回答不了这些问题,那么面试官就会觉得你这个人就只会做表面功夫。
如果你能进一步讲清楚怎么定义好坏、怎么构造测试集、怎么自动评估、怎么线上验证、怎么根据反馈继续迭代,你的项目听起来就不再像 Demo,而更像一个真正长期运行的生产系统。
所以这一讲,我们就专门讨论一个看起来很简单、实际上很麻烦的问题:你怎么知道用户喜不喜欢你的 Agent?
我们先来看看最基础的一些评估和反馈机制。

基础机制

测评集

最基础的方式就是准备一批测试用例,每次修改 Prompt、模型、RAG 或者 Agent 流程之后重新运行,观察指标是否变化。例如前面意图识别里面,我就提到过准备各种标准表达、口语化表达、拒识、多轮对话等测试用例,再计算 Top1、拒识准确率等指标。
确认放弃笔记?
放弃后所记笔记将不保留。
新功能上线,你的历史笔记已初始化为私密笔记,是否一键批量公开?
批量公开的笔记不会为你同步至部落
公开
同步至部落
取消
完成
0/2000
荧光笔
直线
曲线
笔记
复制
AI
  • 深入了解
  • 翻译
    • 英语
    • 中文简体
    • 法语
    • 德语
    • 日语
    • 韩语
    • 俄语
    • 西班牙语
  • 解释
  • 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《AI Agent 系统设计面试现场》
新⼈⾸单¥59
立即购买
登录 后留言

精选留言

由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论
显示
设置
留言
收藏
沉浸
阅读
分享
手机端
快捷键
回顶部