加载中...
上下文窗口是大语言模型一次处理的最大 token 数量,决定了模型能「记住」多少内容。从 GPT-2 的 1024 token,到 GPT-4 Turbo 的 128K,再到 Gemini 1.5 Pro 的 100 万 token,上下文长度的扩展正在重塑 AI 应用的可能边界。

| 类型 | LLM 能力指标 |
| 演进里程碑 | GPT-2: 1K → GPT-4T: 128K → Gemini 1.5 Pro: 1M |
| 关键优化 | FlashAttention、RoPE 位置外推、Ring Attention |
标准自注意力机制的计算复杂度是序列长度 n 的 O(n²):序列翻倍,计算量变 4 倍,显存也变 4 倍。GPT-4 的 32K 上下文和 8K 上下文相比,注意力层算力消耗增加 16 倍。这就是早期模型上下文很短的工程原因,不是不想做长,是真的太贵。
另一个问题是位置外推:模型训练时只见过长度 ≤ L 的序列,推理时如果输入超过 L,位置编码会进入「未见过的区域」,性能骤降。RoPE + NTK-aware 扩展、YaRN 等方法通过调整旋转频率基底实现一定程度的外推。[1]
FlashAttention(2022)通过 IO 感知的分块计算,把注意力的显存复杂度从 O(n²) 降为 O(n),同时速度提升 2-4 倍,是长上下文扩展的关键基础设施。Ring Attention(2023)进一步把超长序列分割到多个 GPU 上计算,理论上可处理无限长序列。
Gemini 1.5 Pro 的 100 万 token 上下文(约 75 万词,相当于 5 本《战争与和平》)让以下应用成为现实:整个代码仓库一次性载入、全书翻译保持一致性、长视频(约 1 小时)全程理解。但「能装下」不等于「都利用好」:长上下文中的「迷失在中间(Lost in the Middle)」现象——模型对上下文开头和结尾的信息利用率远高于中间部分——至今仍是挑战。

| 类型 | LLM 能力指标 |
| 演进里程碑 | GPT-2: 1K → GPT-4T: 128K → Gemini 1.5 Pro: 1M |
| 关键优化 | FlashAttention、RoPE 位置外推、Ring Attention |
登录 后参与讨论
暂无讨论,来发表第一条评论吧