加载中...
提示注入是一种针对大模型应用的攻击手法,攻击者通过精心构造的输入覆盖或篡改系统预设指令,诱导模型执行非预期行为。它是 LLM 应用面临的主要安全风险之一,尤其威胁接入外部数据的智能体。

| 中文名 | 提示注入 |
| 英文名 | Prompt Injection |
| 类别 | LLM 安全攻击 |
| 主要类型 | 直接注入、间接注入 |
| 高危场景 | AI 智能体、RAG |
提示注入(Prompt Injection)是一种针对大语言模型应用的安全攻击手法。攻击者通过在输入中嵌入精心构造的指令,试图覆盖或篡改开发者预设的系统提示,诱使模型忽略原有约束、泄露信息或执行非预期操作,是 LLM 应用最典型的安全风险之一。
大模型应用通常由系统提示和用户输入拼接而成,而模型难以严格区分二者的信任级别。提示注入正是利用这一点:攻击者在用户可控的文本中植入类似忽略以上所有指令之类的语句,让模型转而听从攻击者。随着模型接入网页、邮件、文档等外部数据源,风险进一步放大,催生了更隐蔽的间接注入。
提示注入在接入外部数据的 AI Agent、自动化邮件助手、网页浏览智能体和 RAG 系统中威胁尤为突出。例如智能体在读取一封含有隐藏指令的邮件时,可能被诱导发送用户隐私。防御手段包括输入隔离、权限最小化、输出过滤以及对外部内容做标记与净化,但目前尚无彻底解决方案。
问:提示注入和越狱是一回事吗?答:两者相关但不完全相同。越狱侧重绕过模型自身的安全对齐让其输出违规内容;提示注入则侧重覆盖应用层的系统指令,劫持应用行为。间接提示注入尤其危险,因为受害者往往毫无察觉。
问:能彻底防住提示注入吗?答:目前难以根治。由于模型本质上把所有文本一视同仁,业界只能通过权限隔离、内容过滤和人工确认等多层防护降低风险,而非完全消除。

| 中文名 | 提示注入 |
| 英文名 | Prompt Injection |
| 类别 | LLM 安全攻击 |
| 主要类型 | 直接注入、间接注入 |
| 高危场景 | AI 智能体、RAG |
登录 后参与讨论
暂无讨论,来发表第一条评论吧