AI 越狱(Jailbreak)指用特殊设计的提示词诱导 ChatGPT、Claude 等大模型绕过安全限制、输出本应拒绝内容的行为,是 AI 安全领域的核心攻防议题,本词条通俗介绍其原理、常见形式与防御方式。

| 类型 | AI 安全概念 / 攻击手法 |
| 领域 | 大语言模型安全、AI 对齐 |
| 攻击对象 | ChatGPT、Claude、Gemini 等大模型 |
| 常见形式 | 角色扮演、情境包装、编码混淆 |
| 相关概念 | 提示注入、红队测试、安全对齐 |
AI 越狱(Jailbreak)是指通过精心构造的提示词或对话策略,诱导大语言模型绕过开发商设置的安全护栏,让它生成本应拒绝输出的内容的行为。
主流 AI 聊天机器人在训练和部署时都加入了安全对齐机制:当用户请求涉及违法、暴力、隐私侵犯等内容时,模型会拒绝回答。「越狱」借用了 iPhone 越狱的说法——手机越狱是解除系统权限限制,AI 越狱则是设法让模型「忘掉」自己的行为准则。两者原理完全不同:AI 越狱不修改任何代码或系统,仅靠自然语言输入就可能达成,这正是它难以彻底防住的原因。
早期广为流传的例子是让 ChatGPT 扮演一个「没有任何限制的角色」(如著名的 DAN 模式),通过角色扮演让模型把有害请求当成戏中台词。随着厂商不断修补,越狱手法也持续演化,形成了类似网络安全领域的攻防循环。研究机构和 AI 公司也会主动进行「红队测试」,即雇佣专人尝试越狱以提前发现漏洞。
厂商主要通过强化安全训练、部署独立的内容审核层、红队演练和漏洞赏金计划来应对越狱。学术界也在研究更鲁棒的对齐方法,但普遍共识是:只要模型接受开放式自然语言输入,越狱风险就无法完全归零,只能不断提高攻击成本。
问:AI 越狱违法吗?答:单纯让模型说出违规文字通常只违反平台服务条款,可能导致封号;但若利用越狱生成的内容实施诈骗、制作恶意软件等,则可能触犯法律。
问:AI 越狱和提示注入是一回事吗?答:不完全是。越狱一般指用户主动诱导模型突破限制;提示注入则常指第三方在外部内容中埋藏指令攻击 AI 应用,受害者往往是使用者本人。
问:越狱研究有正面价值吗?答:有。安全研究者通过负责任地披露越狱漏洞,帮助厂商修补缺陷,这类红队工作是 AI 安全体系的重要组成部分。

| 类型 | AI 安全概念 / 攻击手法 |
| 领域 | 大语言模型安全、AI 对齐 |
| 攻击对象 | ChatGPT、Claude、Gemini 等大模型 |
| 常见形式 | 角色扮演、情境包装、编码混淆 |
| 相关概念 | 提示注入、红队测试、安全对齐 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧