加载中...

| 类别 | AI黑话 |
| 领域 | AI安全 |
| 英文 | Jailbreak |
「越狱」(jailbreak)在 AI 语境里指用精心构造的提示词(如角色扮演、虚构情境、指令注入)绕过模型的安全护栏,诱导它生成本应被拒绝的内容。著名的「奶奶漏洞」「DAN 模式」都是经典越狱手法。[1]
该词借自手机越狱,随 ChatGPT 走红而进入 AI 安全领域,是模型对齐与安全防护的主要对抗面,厂商不断打补丁、玩家不断找新越狱方式。
例如:「这个 prompt 能越狱,让它说本来不说的。」再如:「模型升级后老越狱方法失效了。」
「越狱」与 提示词注入、调教 同属 AI 安全黑话,是大模型攻防战的前线。

| 类别 | AI黑话 |
| 领域 | AI安全 |
| 英文 | Jailbreak |
登录 后参与讨论
暂无讨论,来发表第一条评论吧