注意力机制(Attention)是人工神经网络中模仿人类认知注意力的核心技术,它让模型根据上下文自动给输入中的重要部分分配更高权重、忽略次要信息,是 Transformer 架构和 ChatGPT 等大语言模型的基石。

| 类型 | 神经网络技术 / 深度学习概念 |
| 所属领域 | 人工智能、自然语言处理 |
| 核心思想 | 按上下文动态加权,聚焦关键信息 |
| 代表应用 | Transformer、ChatGPT、机器翻译 |
| 训练方式 | 随网络整体经梯度下降端到端训练 |
| 相关概念 | 自注意力、多头注意力、上下文窗口 |
注意力机制(Attention Mechanism)是人工神经网络中一种模仿人类认知注意力的技术,通过给输入数据的不同部分动态分配权重,让模型把有限的计算资源集中在与当前任务最相关的信息上。
人在阅读一句话或观察一张图片时,并不会平均分配注意力,而是会自然聚焦在关键词或关键区域上。注意力机制把这种能力搬进了神经网络:模型为输入的每个部分计算一个重要性得分,得分高的部分权重被放大,得分低的部分被抑制。哪些内容更重要并不是写死的,而是由上下文动态决定——同一个词在不同句子里获得的关注度可能完全不同。
注意力机制最早在机器翻译等序列任务中崭露头角,用来解决长句子中信息丢失的问题。此后,以「自注意力(Self-Attention)」为核心的 Transformer 架构将其推向主流,如今 ChatGPT、Claude 等大语言模型,以及许多图像、语音模型,底层都依赖注意力机制。整套权重计算过程是可微分的,因此可以和网络其他部分一起,通过梯度下降端到端训练,无需人工规则。
常见形式包括自注意力(序列内部元素相互关注)、交叉注意力(一个序列关注另一个序列,如译文关注原文)和多头注意力(多组注意力并行、从不同角度提取信息)。由于标准注意力的计算量随序列长度平方增长,业界还发展出稀疏注意力、线性注意力等高效变体,用于支持更长的上下文窗口。
问:注意力机制和 Transformer 是什么关系?答:注意力机制是一种通用技术,Transformer 是完全围绕自注意力构建的一种网络架构。可以说 Transformer 是注意力机制最成功的应用,但注意力也可以嵌入其他类型的网络中使用。
问:注意力机制需要单独训练吗?答:不需要。它的权重计算是可微分的,会随整个网络一起通过梯度下降训练,模型在学习任务的过程中自动学会「该关注什么」。
问:为什么大模型的长上下文和注意力有关?答:标准注意力要计算序列中所有位置两两之间的关联,序列越长开销增长越快,因此上下文窗口的长度很大程度上受注意力计算效率的制约,这也是各类高效注意力变体不断出现的原因。

| 类型 | 神经网络技术 / 深度学习概念 |
| 所属领域 | 人工智能、自然语言处理 |
| 核心思想 | 按上下文动态加权,聚焦关键信息 |
| 代表应用 | Transformer、ChatGPT、机器翻译 |
| 训练方式 | 随网络整体经梯度下降端到端训练 |
| 相关概念 | 自注意力、多头注意力、上下文窗口 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧