21|Agent 检索性能优化:最小充分检索、动态预算与缓存
邓明

你好,我是大明。
前面我们讨论了查询改写、问题拆解、多路召回、混合检索、重排序和迭代式检索。这些方案确实能提高准确率,也很适合在面试中刷亮点。但你一旦讲得太复杂,面试官很可能马上追问:
你又改写 Query,又查多个数据源,还要重排序和追加检索,那性能怎么办?用户要等多久?
这个问题很现实。检索链路越复杂,模型调用次数、Token 成本和整体延迟都会上升。最后用户问一个问题,要等十几秒才能拿到结果,结果再准确,体验也不会太好。
当然你可以狡辩说“我对性能的要求并不是很高,差不多能用就行”,但是这样回答终究是落入了下乘。
所以这一讲我们就讨论怎么提高检索性能,确保在面试官追问的时候可以再加点分。不过,性能优化不只是把一次向量查询从 200ms 优化到 100ms。对 Agent 来说,更重要的是:能少查就少查,能并行就并行,查够了就停止,不够再逐步升级。
检索性能到底指什么?
在讨论怎么优化性能之前,我们先把一个问题说清楚:检索性能究竟是什么?
很多人一提到检索性能,第一反应就是 Elasticsearch 查询用了多少毫秒,Milvus 的向量检索能做到多少 QPS,或者把一次查询从 200ms 优化到了 100ms。这些当然属于检索性能,不过稍微有点传统了。对于 Agent 来说,视野要放宽一点。
公开
同步至部落
取消
完成
0/2000
笔记
复制
AI
- 深入了解
- 翻译
- 解释
- 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《AI Agent 系统设计面试现场》,新⼈⾸单¥59
《AI Agent 系统设计面试现场》,新⼈⾸单¥59
立即购买
© 版权归极客邦科技所有,未经许可不得传播售卖。 页面已增加防盗追踪,如有侵权极客邦将依法追究其法律责任。
登录 后留言
精选留言
由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论