加载中...

| 类型 | 机器学习范式 |
| NLP 代表 | BERT(MLM)、GPT(CLM) |
| 视觉代表 | SimCLR、MoCo、MAE(Masked Autoencoders) |
自监督学习的关键在于设计一个前置任务(Pretext Task):从原始数据中自动生成标签,训练完成后这些标签本身不重要,重要的是模型学到的表示。
NLP 里经典的前置任务:掩码语言模型(MLM)随机遮住 15% 的词让模型预测(BERT 的核心);下一句预测(NSP)判断两句话是否相邻(BERT 的辅助任务,后来被证明不怎么有效);下一个词预测(CLM)是 GPT 系列的方式,看上去更「简单」但在超大规模上效果反而更强。
视觉领域:SimCLR(2020)对同一图片做不同的数据增强(裁剪、翻转、颜色抖动),让两个增强版本的 embedding 互相靠近,让不同图片的 embedding 互相远离。这样模型学到图片的内容表示而非具体像素。[1]
自监督不是无监督,两者最容易混淆。无监督(如 K-means 聚类)完全不用标签,自监督则有标签——只是这些标签是从数据本身自动派生的,而非人工标注。
相比有监督学习,自监督最大的优势是可以利用无限多的无标注数据。GPT-3 在 5000 亿 token 上训练,这些文本不需要任何人工标注,只需要爬取整个互联网。LeCun 大力鼓吹的世界模型和 JEPA(Joint Embedding Predictive Architecture)也是自监督路线,他认为这是实现真正通用智能的关键,而非当前基于 token 预测的语言模型路线。

| 类型 | 机器学习范式 |
| NLP 代表 | BERT(MLM)、GPT(CLM) |
| 视觉代表 | SimCLR、MoCo、MAE(Masked Autoencoders) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧