加载中...

《Attention Is All You Need》是 Google 研究团队于 2017 年发表于 NeurIPS 的论文,作者包括 Ashish Vaswani、Noam Shazeer 等八人。论文提出了完全基于注意力机制的 Transformer 架构,摒弃了此前主流的循环与卷积结构。
论文以自注意力(Self-Attention)替代 RNN 的时序依赖,使序列内任意两个位置可以直接交互,训练可以充分并行。配合多头注意力、位置编码、残差连接与层归一化,模型在机器翻译任务上以更低的训练成本取得了当时的最佳效果。
该论文是深度学习史上引用量最高的工作之一。BERT、GPT 系列、T5 以及几乎所有现代大语言模型均以其提出的 Transformer 为基础架构,八位作者后来多数离开 Google 参与创办 AI 公司,被业界称为「Transformer 八子」。

登录 后参与讨论
暂无讨论,来发表第一条评论吧