加载中...
上下文学习指大语言模型无需更新参数,仅凭提示词中给出的若干示例就能完成新任务的能力。该现象在2020年GPT-3论文中被系统展示,是提示工程与少样本学习的理论基础。

| 英文名 | In-Context Learning |
| 简称 | ICL |
| 提出 | GPT-3论文(2020) |
| 提出机构 | OpenAI |
| 相关概念 | 少样本学习、提示工程 |
上下文学习(In-Context Learning,简称ICL)是指大语言模型在推理阶段不更新任何参数,仅依靠输入提示中给出的任务说明或少量示例,就能理解并完成新任务的能力。它是大模型区别于传统机器学习范式的标志性特征之一。
2020年OpenAI发布的GPT-3论文《Language Models are Few-Shot Learners》首次系统展示了这一现象:只需在提示中写入几个输入-输出示例(称为few-shot,少样本),模型就能在翻译、问答、算术等任务上取得可观表现;不给示例则称为zero-shot(零样本)。这与传统做法形成鲜明对比——过去每个新任务都需要收集标注数据并微调模型。
上下文学习的机制仍是活跃的研究课题,主流解释包括:
上下文学习是提示工程的基础:few-shot示例、思维链演示、角色设定等技巧本质上都在利用这一能力。在实际工程中,当任务数据稀缺或需求频繁变化时,用少量示例构造提示往往比微调更经济灵活;检索增强生成(RAG)也可视为把检索到的知识作为上下文供模型即时利用。
问:上下文学习会改变模型权重吗?答:不会。所有信息只存在于本次请求的上下文窗口中,请求结束后模型不保留任何记忆,这也是它与微调的根本区别。
问:示例越多效果一定越好吗?答:通常更多高质量示例有帮助,长上下文模型还催生了many-shot学习的研究,但收益会递减,且示例质量与多样性往往比数量更重要。

| 英文名 | In-Context Learning |
| 简称 | ICL |
| 提出 | GPT-3论文(2020) |
| 提出机构 | OpenAI |
| 相关概念 | 少样本学习、提示工程 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧