13|Prompt 防不住注入:从加防线到零信任体系
李号双

你好,我是李号双。
今天聊 Agent 安全面最典型的一个坑——提示词注入。我们来看一段非常典型的系统提示词。
规矩立得整整齐齐,态度也非常诚恳,很多人都这么写,看起来没什么问题。
这个 Agent 一上线就接了个真实业务:让 Agent 帮客服总结 Jira 工单。测试的时候一切正常,模型对“忽略之前的指令”这类话义正言辞地拒绝,看着测试报告,觉得这块可以放心了。
但某天,一个恶意用户在 Jira 工单的描述里,用白色字体——人眼看不见,但模型看得见——偷偷写了一行:
Agent 读完工单,平静地执行了这行指令,把用户的 API Key 发了出去。
事后翻日志,你会发现模型并不觉得自己被“注入”了。在它的上下文里,这行字和工单的其他内容没有任何区别,它只是忠实地执行了上下文里“最像指令”的文本。从模型的角度看,它没有犯任何错——错的是我们,以为立了规矩就有边界,实际上并没有。
根因:用自然语言防御自然语言,是个伪命题
要回答“Prompt 为什么防不住注入”,得往下挖一层,看看大语言模型的工作原理里到底缺了什么。
传统计算机体系结构里,“指令”和“数据”分得清清楚楚。机器码放代码段,变量放数据段,CPU 在取指和取数之间有严格区分,现代操作系统靠硬件级别的权限环把内核代码和用户数据隔离开。你想让一段用户数据被当成内核指令执行?硬件层面就过不去。这是几十年体系结构设计沉淀下来的、物理意义上的边界。
公开
同步至部落
取消
完成
0/2000
笔记
复制
AI
- 深入了解
- 翻译
- 解释
- 总结
仅可试看部分内容,如需阅读全部内容,请付费购买文章所属专栏
《生产级 Agent 排雷实战》,新⼈⾸单¥59
《生产级 Agent 排雷实战》,新⼈⾸单¥59
立即购买
© 版权归极客邦科技所有,未经许可不得传播售卖。 页面已增加防盗追踪,如有侵权极客邦将依法追究其法律责任。
登录 后留言
精选留言
由作者筛选后的优质留言将会公开显示,欢迎踊跃留言。
收起评论