加载中...
注意力机制让神经网络在处理每个词时动态聚焦于输入序列中最相关的部分,而非平均对待所有信息。Transformer 架构的核心就是多头自注意力,它让 GPT、BERT 等大模型成为可能。

| 类型 | 神经网络核心组件 |
| 提出年份 | 2015(Bahdanau),2017(Transformer 自注意力) |
| 计算复杂度 | O(n²·d),n 为序列长度 |
早期机器翻译用 RNN 做编解码器,但编码器要把整句话压进一个固定长度的向量再传给解码器,长句子时信息大量丢失。2015 年 Bahdanau 等人提出注意力机制:解码器在生成每个词时,可以「回头看」编码器所有时间步的隐藏状态,并根据相关度分配不同的权重——这个权重就叫 attention score。
2017 年「Attention Is All You Need」论文更激进:完全抛弃 RNN,只用注意力机制构建 Transformer。输入序列里每个位置都能直接和其他所有位置交互,不再受 RNN 顺序计算的限制,并行度极高,适合 GPU 大规模训练。[1]
自注意力(Self-Attention)把每个 token 的向量线性变换成三个向量:Query(我要问什么)、Key(我能提供什么标签)、Value(我的实际内容)。用 Q 和所有 K 的点积算相似度,再 softmax 归一化得到权重,最后对 V 加权求和,得到该 token 的新表示。
多头注意力(Multi-Head Attention)把这个过程并行做 h 次(GPT-3 是 96 头),每个头关注不同的语义模式:有的头学句法依存,有的头学指代消解,最后拼接再投影。计算复杂度是序列长度 n 的 O(n²),这也是为什么超长上下文(100K token)会显著变慢并需要专门优化(如 FlashAttention、Sparse Attention)。

| 类型 | 神经网络核心组件 |
| 提出年份 | 2015(Bahdanau),2017(Transformer 自注意力) |
| 计算复杂度 | O(n²·d),n 为序列长度 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧