加载中...

Vision Transformer(ViT)是 Google 研究团队于 2020 年提出的图像识别架构,首次证明不依赖卷积、纯 Transformer 结构在大规模预训练下可以达到乃至超越顶尖卷积网络的图像分类性能。
ViT 将输入图像切分为固定大小的补丁(patch,如 16×16 像素),每个补丁经线性映射成向量并加上位置编码,构成序列输入标准 Transformer 编码器;序列前附加一个分类标记(class token),其输出经全连接层得到类别预测。自注意力机制使模型从浅层起就能建模全局依赖。
ViT 缺少卷积的局部性与平移不变性先验,小数据下易过拟合,需要大规模数据或强数据增强(如 DeiT 的蒸馏策略)才能发挥优势。
ViT 开启了视觉领域的 Transformer 时代,成为 CLIP、SAM、DINO 等模型的骨干,也推动了多模态大模型中视觉编码器的统一。

登录 后参与讨论
暂无讨论,来发表第一条评论吧