加载中...
视觉 Transformer 是谷歌于 2020 年提出的图像识别模型,将图像切分为若干小块并当作序列输入标准 Transformer 处理。它证明了在大规模数据上纯注意力结构可以媲美甚至超越卷积神经网络,推动了 Transformer 在计算机视觉领域的普及。

| 英文名 | Vision Transformer |
| 提出机构 | 谷歌 |
| 提出时间 | 2020 年 |
| 处理方式 | 图像分块序列化 |
| 典型任务 | 图像分类 |
视觉 Transformer(Vision Transformer,简称 ViT)是谷歌团队在 2020 年提出的图像分类模型。它的核心思想是把一张图像切分成固定大小的图像块,将每个块线性映射为向量后当作词元序列,直接输入标准 Transformer 编码器进行处理,从而把自然语言处理中的成功架构迁移到视觉领域。
长期以来,计算机视觉由卷积神经网络主导。ViT 打破了这一局面,表明当训练数据足够充分时,不依赖卷积的纯注意力模型同样能取得领先的识别效果。这一结果激发了大量后续工作,使 Transformer 成为视觉领域的重要架构选择。
ViT 及其变体广泛用于图像分类、目标检测、图像分割和多模态理解等任务,也是许多图文对齐模型和视觉大模型的骨干网络。在自动驾驶、医学影像和内容审核等领域都有实际落地。
问:ViT 一定比卷积神经网络更好吗?答:不绝对。ViT 通常需要更大规模的数据才能充分发挥优势;在小数据集上,卷积网络凭借其归纳偏置往往更稳定,两者常结合使用。
问:ViT 为什么要引入位置编码?答:自注意力本身不区分输入顺序,而图像块的空间位置至关重要,因此需要位置编码来告知模型每个块的相对或绝对位置。

| 英文名 | Vision Transformer |
| 提出机构 | 谷歌 |
| 提出时间 | 2020 年 |
| 处理方式 | 图像分块序列化 |
| 典型任务 | 图像分类 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧