AI Agent 系统设计面试现场
邓明
前大厂资深专家,AI 领域连续创业者
3311 人已学习
新⼈⾸单¥59
登录后,你可以任选4讲全文学习
课程目录
已更新 25 讲/共 28 讲
AI Agent 系统设计面试现场
15
15
1.0x
00:00/00:00
登录|注册

21|Agent 检索性能优化:最小充分检索、动态预算与缓存

你好,我是大明。
前面我们讨论了查询改写、问题拆解、多路召回、混合检索、重排序和迭代式检索。这些方案确实能提高准确率,也很适合在面试中刷亮点。但你一旦讲得太复杂,面试官很可能马上追问:
你又改写 Query,又查多个数据源,还要重排序和追加检索,那性能怎么办?用户要等多久?
这个问题很现实。检索链路越复杂,模型调用次数、Token 成本和整体延迟都会上升。最后用户问一个问题,要等十几秒才能拿到结果,结果再准确,体验也不会太好。
当然你可以狡辩说“我对性能的要求并不是很高,差不多能用就行”,但是这样回答终究是落入了下乘。
所以这一讲我们就讨论怎么提高检索性能,确保在面试官追问的时候可以再加点分。不过,性能优化不只是把一次向量查询从 200ms 优化到 100ms。对 Agent 来说,更重要的是:能少查就少查,能并行就并行,查够了就停止,不够再逐步升级。

检索性能到底指什么?

在讨论怎么优化性能之前,我们先把一个问题说清楚:检索性能究竟是什么?
很多人一提到检索性能,第一反应就是 Elasticsearch 查询用了多少毫秒,Milvus 的向量检索能做到多少 QPS,或者把一次查询从 200ms 优化到了 100ms。这些当然属于检索性能,不过稍微有点传统了。对于 Agent 来说,视野要放宽一点。
确认放弃笔记?
放弃后所记笔记将不保留。
新功能上线,你的历史笔记已初始化为私密笔记,是否一键批量公开?
批量公开的笔记不会为你同步至部落
公开
同步至部落
取消
完成
0/2000
荧光笔
直线
曲线
笔记
复制
AI
  • 深入了解
  • 翻译
    • 英语
    • 中文简体
    • 法语
    • 德语
    • 日语
    • 韩语
    • 俄语
    • 西班牙语
  • 解释
  • 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《AI Agent 系统设计面试现场》
新⼈⾸单¥59
立即购买
登录 后留言

精选留言

由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论
显示
设置
留言
收藏
沉浸
阅读
分享
手机端
快捷键
回顶部