加载中...
对抗样本是通过对输入施加人眼几乎察觉不到的微小扰动,使模型给出错误预测的样本。它揭示了深度模型的脆弱性,是AI安全与鲁棒性研究的核心议题。

| 中文名 | 对抗样本 |
| 英文名 | Adversarial Example |
| 所属领域 | AI安全、鲁棒性 |
| 关键手段 | 梯度扰动 |
| 常见防御 | 对抗训练 |
对抗样本(Adversarial Example)是在正常输入上添加精心设计的、通常人类难以察觉的微小扰动,从而诱导机器学习模型给出错误输出的样本。它暴露了深度神经网络在鲁棒性上的严重缺陷。
研究者发现,一张被正确分类的图片,只要加上一层肉眼几乎看不出的噪声,就可能被模型高置信度地误判为完全不同的类别。这种脆弱性并非偶然,而是高维模型决策边界特性的普遍现象,在图像、文本、语音等各类任务中都存在。
对抗样本研究一方面用于攻击测试,评估模型在安全敏感场景下的可靠性;另一方面推动了对抗训练等防御方法,把对抗样本纳入训练以提升鲁棒性。它在自动驾驶、人脸识别、内容安全等领域具有重要现实意义。
问:对抗样本只存在于图像模型吗?答:不是,文本、语音乃至大语言模型都可能被对抗性输入误导,只是扰动的形式不同。
问:如何防御对抗样本?答:常见做法包括对抗训练、输入预处理和检测机制,但目前尚无能抵御所有攻击的通用方案。

| 中文名 | 对抗样本 |
| 英文名 | Adversarial Example |
| 所属领域 | AI安全、鲁棒性 |
| 关键手段 | 梯度扰动 |
| 常见防御 | 对抗训练 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧