23|你怎么知道用户喜不喜欢你的 Agent?
邓明

你好,我是大明。
前面我们已经讨论了意图识别、Plan、Replan、上下文管理、RAG 等一大堆 Agent 机制。到这里,有一个问题无论如何都绕不过去:你做了这么多优化,怎么知道 Agent 真的变好了?
比如说你把意图识别改成三层机制,怎么证明准确率提高了?给 RAG 加了混合检索、Rerank、迭代式检索,怎么知道用户体验更好了?又或者你做了用户画像、动态上下文,用户真的买账吗?
如果回答不了这些问题,那么面试官就会觉得你这个人就只会做表面功夫。
如果你能进一步讲清楚怎么定义好坏、怎么构造测试集、怎么自动评估、怎么线上验证、怎么根据反馈继续迭代,你的项目听起来就不再像 Demo,而更像一个真正长期运行的生产系统。
所以这一讲,我们就专门讨论一个看起来很简单、实际上很麻烦的问题:你怎么知道用户喜不喜欢你的 Agent?
我们先来看看最基础的一些评估和反馈机制。
基础机制
测评集
最基础的方式就是准备一批测试用例,每次修改 Prompt、模型、RAG 或者 Agent 流程之后重新运行,观察指标是否变化。例如前面意图识别里面,我就提到过准备各种标准表达、口语化表达、拒识、多轮对话等测试用例,再计算 Top1、拒识准确率等指标。
公开
同步至部落
取消
完成
0/2000
笔记
复制
AI
- 深入了解
- 翻译
- 解释
- 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《AI Agent 系统设计面试现场》,新⼈⾸单¥59
《AI Agent 系统设计面试现场》,新⼈⾸单¥59
立即购买
© 版权归极客邦科技所有,未经许可不得传播售卖。 页面已增加防盗追踪,如有侵权极客邦将依法追究其法律责任。
登录 后留言
精选留言
由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论