加载中...

CLIP(Contrastive Language-Image Pre-training)是 OpenAI 于 2021 年发布的多模态预训练模型,通过在海量图文对上进行对比学习,把图像和自然语言映射到同一个语义向量空间。
模型由图像编码器(ResNet 或 ViT)和文本编码器(Transformer)组成,训练时最大化匹配图文对的向量相似度、最小化不匹配对的相似度。推理时只需把候选类别写成文本提示(如 "a photo of a cat"),与图像向量比较相似度即可完成分类,无需针对具体任务再训练,即零样本(zero-shot)能力。
CLIP 证明了自然语言监督可替代人工标注类别,其图文对齐空间成为后续技术的基础设施:Stable Diffusion 用其文本编码器引导图像生成,开放词汇检测与分割、图文检索也普遍构建在类 CLIP 模型之上。
对细粒度识别、计数和抽象推理能力有限,且继承了网络训练数据中的偏见。

登录 后参与讨论
暂无讨论,来发表第一条评论吧