加载中...

| 类型 | 神经网络架构 |
| 英文名 | Transformer |
| 提出者 | 谷歌研究团队 |
| 提出时间 | 2017年 |
| 主要领域 | 自然语言处理、计算机视觉与多模态人工智能 |
Transformer(变换器模型)是一种以注意力机制为核心的神经网络架构,能够理解输入中不同元素之间的关系,是现代生成式人工智能和大语言模型的重要基础。
Transformer由谷歌研究团队在2017年提出。与依次处理数据的循环神经网络不同,它可以并行分析一段序列中的多个位置,从而提高训练效率,并更好地学习相距较远的词语或数据之间的联系。
该架构最初主要用于机器翻译,后来扩展到文本分类、搜索、问答、代码生成、语音处理、图像识别和多模态内容生成等领域。GPT、BERT等知名模型都建立在Transformer架构或其变体之上。
经典Transformer通常包含编码器和解码器。编码器负责提取和表示输入信息,解码器根据已有内容生成输出。不同应用会采用完整结构,也可能只保留编码器或解码器。模型还会加入位置编码,使其能够识别序列中元素的先后顺序。
问:Transformer就是大语言模型吗?答:不是。Transformer是一类模型架构,大语言模型则是使用大量数据训练出的具体模型,许多大语言模型采用了Transformer。
问:Transformer只能处理文字吗?答:不能。经过适配后,它也可处理图像、音频、视频、程序代码及多模态数据。
问:Transformer有什么局限?答:大型Transformer通常需要较多算力、存储空间和训练数据,处理很长的输入时也可能带来较高计算成本。

| 类型 | 神经网络架构 |
| 英文名 | Transformer |
| 提出者 | 谷歌研究团队 |
| 提出时间 | 2017年 |
| 主要领域 | 自然语言处理、计算机视觉与多模态人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧