加载中...

掩码语言建模(Masked Language Modeling,MLM)是一种自监督预训练目标:随机把输入中一部分词元替换为特殊的 [MASK] 标记(BERT 中比例为 15%),训练模型根据双向上下文还原被遮盖的词。
与只看左侧上下文的自回归目标不同,MLM 允许模型同时利用左右两侧信息,学到的表征更适合理解类任务。BERT 还对被选中的词做了 80% 替换为 [MASK]、10% 随机替换、10% 保持不变的处理,以缓解预训练与微调阶段输入分布不一致的问题。
RoBERTa 采用动态掩码提升效果;T5 将其推广为遮盖连续片段的 span corruption;ELECTRA 改为判别「哪个词被替换过」以提高样本效率。MLM 训练的编码器模型至今仍是文本嵌入、检索与分类任务的主力。

登录 后参与讨论
暂无讨论,来发表第一条评论吧