欢迎回来!
上节课,我们给 AI 系统装上了完整的 CI/CD 护栏——六类触发事件、七维质量快照、五阶段流水线、三档发布决策。到这里,你能保证变更中的问题在上线前被拦住。
但 CI 解决的是"可以预料的变化"。生产环境里的失败,往往是你根本没预料到的。而 AI 系统的失败方式,和传统系统完全不同:

失败是沉默的:模型继续运行、HTTP 200 正常返回,但生成的答案已经悄悄变差了——没有任何报错信号
质量是概率分布:不是"崩溃",而是代码采用率从 85% 滑落到 72%,没有异常堆栈,只有用户在沉默地不满意
来源是多元隐蔽的:你没改一行代码,但上游模型悄悄更新了,Prompt 缓存失效了,用户输入分布变了
这三点,决定了你不能靠"等错误日志"来感知 AI 的问题。线上监控要解决的,正是 CI 解决不了的那部分——让你第一时间知道 AI 系统的真实运行状态,而不是等用户来告诉你"出问题了"。
这节课,我带你搭建一套完整的 AI 应用线上监控体系。六层指标、告警策略设计、从工具选型到实际配置,用一个代码辅助 Agent 的具体场景贯穿——你大概率接触过这类工具,有直接感受,最适合把抽象指标变成可以想象的东西。
AI 应用线上监控的第一认知跃迁:HTTP 200 ≠ 成功。
