Transformer 架构是一种基于自注意力机制的深度学习模型架构,由 Google 团队在论文《Attention Is All You Need》中提出,能高效并行处理序列数据,是 GPT、Claude 等大语言模型的技术基石。

| 类型 | 深度学习模型架构 |
| 提出机构 | |
| 提出时间 | 2017 年 |
| 代表论文 | Attention Is All You Need |
| 核心机制 | 自注意力(Self-Attention) |
| 代表应用 | GPT、BERT、Claude、ViT |
Transformer 架构是一种基于自注意力机制(Self-Attention)的深度学习模型架构,最初为机器翻译任务设计,如今已成为 GPT、Claude、Gemini 等大语言模型的共同技术基础。
Transformer 由 Google 研究团队在 2017 年的论文《Attention Is All You Need》中提出。在它出现之前,处理文本等序列数据主要依赖循环神经网络(RNN)和长短期记忆网络(LSTM),这类模型必须逐词顺序计算,训练速度慢,且难以记住长距离的上下文。
Transformer 彻底抛弃了循环结构,改用注意力机制让序列中的每个词直接「关注」其他所有词,从而一次性并行处理整段文本。这一改变大幅提升了训练效率,使在海量数据上训练超大规模模型成为可能,直接催生了后来的大语言模型浪潮。
经典的 Transformer 由编码器(Encoder)和解码器(Decoder)两部分组成,后续模型常只取其一:BERT 采用编码器结构,GPT 系列则采用解码器结构。
Transformer 最初用于自然语言处理,如翻译、摘要和问答,随后扩展到几乎所有 AI 领域:视觉领域的 ViT 将其用于图像识别,语音识别、蛋白质结构预测(如 AlphaFold)以及文生图、文生视频模型中也都有它的身影。可以说,近年来生成式 AI 的爆发很大程度上建立在 Transformer 之上。
问:Transformer 和 GPT 是什么关系?答:Transformer 是底层架构,GPT(Generative Pre-trained Transformer)是基于其解码器部分构建的具体模型系列,名字里的 T 就是 Transformer。
问:为什么 Transformer 能取代 RNN?答:它支持并行计算、训练速度快,且自注意力机制能直接建模长距离依赖,克服了 RNN 顺序计算慢、长文本容易「遗忘」的缺陷。
问:Transformer 只能处理文本吗?答:不是。它对任何可以表示为序列的数据都适用,目前已广泛用于图像、音频、视频和生物序列等多种模态。

| 类型 | 深度学习模型架构 |
| 提出机构 | |
| 提出时间 | 2017 年 |
| 代表论文 | Attention Is All You Need |
| 核心机制 | 自注意力(Self-Attention) |
| 代表应用 | GPT、BERT、Claude、ViT |
登录 后参与讨论
暂无讨论,来发表第一条评论吧