上下文窗口(Context Window)是大语言模型单次能处理的最大文本长度,以 token 为单位计量。它决定了 AI 一次能「记住」多少对话内容和输入资料,是衡量 ChatGPT、Claude、Gemini 等大模型能力的重要指标。

| 类型 | 人工智能术语 |
| 英文名 | Context Window |
| 所属领域 | 大语言模型 / 自然语言处理 |
| 计量单位 | token(词元) |
| 相关架构 | Transformer |
| 相关技术 | RAG、注意力机制 |
上下文窗口(Context Window)是指大语言模型(LLM)在一次处理中所能容纳的最大输入与输出文本长度,通常以 token(词元)为计量单位。
大语言模型在生成回答时,并不是凭空作答,而是基于当前「看得到」的全部内容——包括系统指令、历史对话、用户提供的文档等。这些内容加在一起的容量上限,就是上下文窗口。可以把它理解为模型的「短期记忆」:窗口越大,模型一次能记住和参考的信息就越多。
早期语言模型的上下文窗口只有几千个 token,处理长文档时必须切分输入。随着技术发展,主流大模型的窗口已扩展到数十万甚至百万级 token,足以一次读入整本书或整个代码仓库。扩充上下文窗口一直是各家模型厂商竞争的重点方向之一。
对基于 Transformer 架构的模型而言,扩大窗口并非没有代价:注意力机制的计算开销会随序列长度快速增长,因此长上下文往往意味着更高的推理成本和更慢的响应速度,工程上需要在容量、成本与性能之间权衡。
当资料量超出上下文窗口时,常用检索增强生成(RAG)作为补充:先从外部知识库检索相关片段,再把最相关的内容放进窗口。长窗口与 RAG 并非互相取代,实际应用中往往结合使用。
问:上下文窗口越大越好吗?答:不一定。更大的窗口带来更高的算力成本和延迟,且模型对超长内容的利用效率可能下降,应按实际场景选择。
问:超出上下文窗口会怎样?答:超出部分通常会被截断或导致请求报错,多轮对话中最早的内容会被「挤出」窗口,模型随之遗忘。
问:上下文窗口等于模型的知识量吗?答:不等于。模型的知识来自训练数据,存储在参数中;上下文窗口只是单次交互中临时可用的「工作记忆」。

| 类型 | 人工智能术语 |
| 英文名 | Context Window |
| 所属领域 | 大语言模型 / 自然语言处理 |
| 计量单位 | token(词元) |
| 相关架构 | Transformer |
| 相关技术 | RAG、注意力机制 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧