加载中...

数据增强(Data Augmentation)指在不额外采集数据的前提下,对已有训练样本施加保持标签语义的随机变换,生成新的训练样本,以扩充数据多样性、提升模型泛化能力。
图像领域最为成熟:随机裁剪、翻转、旋转、色彩抖动是基础操作;进阶方法有混合类的 Mixup、CutMix,遮挡类的 Cutout/Random Erasing,以及自动搜索增强策略的 AutoAugment、RandAugment。文本领域常用同义词替换、回译、随机删除(如 EDA 方法);语音领域的 SpecAugment 对频谱做时间与频率遮挡。
增强相当于向模型注入不变性先验(如「平移不改变类别」),等效于某种正则化;在对比学习等自监督方法中,增强更是构造正样本对的核心。
增强强度需与任务匹配,过强会破坏标签语义;测试时增强(TTA)则是推理阶段对多个增强版本预测取平均的相关技巧。

登录 后参与讨论
暂无讨论,来发表第一条评论吧