加载中...

| 类别 | 科技名词 |
| 年份 | 2017 年 |
| 领域 | 信息技术 |
Transformer是Google于2017年在论文《Attention Is All You Need》中提出的神经网络架构。它摒弃了循环与卷积结构,完全依赖注意力机制对序列建模,从而在并行计算与长程依赖建模上取得突破。Transformer现已成为自然语言处理、计算机视觉乃至多模态领域的主导架构,是大语言模型的技术基石。[1]
Transformer的核心是自注意力(Self-Attention)机制:对序列中每个位置,计算其与所有位置的查询(Query)、键(Key)、值(Value)向量的相关性权重,从而聚合全局信息。多头注意力(Multi-Head Attention)并行使用多组投影,以捕捉不同子空间的关系。由于注意力本身不含顺序信息,需引入位置编码。每层还包含前馈网络、残差连接与层归一化。原始架构含编码器与解码器,后续衍生出仅编码器(如BERT)、仅解码器(如GPT系列)等变体。
Transformer的优势是高度并行、可有效建模长程依赖、具备良好的可扩展性,模型性能随参数与数据规模稳定提升。其主要缺陷是自注意力的计算与内存复杂度随序列长度呈平方增长,促使了稀疏注意力、线性注意力及各类高效变体的研究。
Transformer支撑了机器翻译、文本生成、问答等任务,并扩展至图像(Vision Transformer)、语音与蛋白质结构预测等领域,是当前人工智能能力跃升的关键架构。

| 类别 | 科技名词 |
| 年份 | 2017 年 |
| 领域 | 信息技术 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧