加载中...

BERT(Bidirectional Encoder Representations from Transformers)是 Google 于 2018 年发布的预训练语言模型,采用 Transformer 编码器堆叠,分 Base(1.1 亿参数)与 Large(3.4 亿参数)两个规模。
BERT 通过两个自监督任务预训练:掩码语言建模(随机遮住部分词让模型预测)和下一句预测。双向注意力使每个词同时看到左右上下文,表征能力远超单向模型。预训练完成后,只需在其上加简单输出层并微调,即可适配分类、问答、序列标注等任务。
BERT 发布时在 GLUE、SQuAD 等基准上大幅刷新纪录,确立了「预训练+微调」范式,催生 RoBERTa、ALBERT、中文的 ERNIE 等大批后续模型。尽管生成式的解码器架构后来成为主流,BERT 类编码器模型至今仍广泛用于搜索、推荐与文本嵌入。

登录 后参与讨论
暂无讨论,来发表第一条评论吧