加载中...
CLIP 是 OpenAI 于 2021 年提出的多模态模型,通过对比学习在海量图文对上联合训练图像编码器和文本编码器,使图像与文字映射到同一语义空间。它具备强大的零样本识别能力,是众多文生图和多模态系统的基础组件。

| 全称 | Contrastive Language-Image Pre-training |
| 提出机构 | OpenAI |
| 发布时间 | 2021 年 |
| 训练方式 | 对比学习 |
| 核心能力 | 零样本图像分类 |
CLIP(Contrastive Language-Image Pre-training)即对比式语言-图像预训练,是 OpenAI 在 2021 年发布的多模态模型。它同时训练一个图像编码器和一个文本编码器,让匹配的图文对在共享的向量空间中彼此靠近、不匹配的相互远离,从而学到跨模态的语义对齐能力。
CLIP 使用从互联网收集的数亿量级图文对进行训练,不依赖人工标注的固定类别。训练完成后,只需用自然语言描述类别,模型即可对未见过的图像进行分类,这种无需额外训练样本的能力被称为零样本识别,极大拓展了视觉模型的通用性。
CLIP 被广泛用于图文检索、零样本图像分类、内容审核和图像标注。它更重要的价值在于作为基础模块,支撑了众多文生图模型的文本引导以及多模态大模型的视觉理解能力。
问:CLIP 能直接生成图像吗?答:不能。CLIP 本身只负责理解和对齐图文,不具备生成能力,但它常与扩散模型等生成模型配合,为其提供文本引导信号。
问:CLIP 的零样本能力可靠吗?答:在常见概念上表现良好,但对细粒度、专业或罕见类别可能出错,且会受训练数据偏差影响,实际应用时需评估具体场景。

| 全称 | Contrastive Language-Image Pre-training |
| 提出机构 | OpenAI |
| 发布时间 | 2021 年 |
| 训练方式 | 对比学习 |
| 核心能力 | 零样本图像分类 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧