预训练(Pre-training)是训练大语言模型的第一阶段,让模型在海量文本数据上自监督学习语言规律与世界知识,是 GPT、Claude 等 AI 大模型能力的基础,之后再通过微调对齐具体任务。

| 类型 | 机器学习训练范式 / AI 术语 |
| 所属领域 | 人工智能、深度学习、自然语言处理 |
| 训练方式 | 自监督学习(如预测下一个词) |
| 典型产物 | 基座模型(Base Model) |
| 代表应用 | GPT、Claude、Llama 等大语言模型 |
| 后续阶段 | 指令微调、RLHF 对齐 |
预训练(Pre-training)是指让人工智能模型先在海量通用数据上进行大规模训练、学习通用知识和规律的过程,是构建大语言模型的第一个也是最关键的阶段。
在深度学习早期,模型通常针对单一任务从零开始训练,需要大量人工标注数据,成本高且难以复用。预训练思路则相反:先让模型在互联网网页、书籍、代码等海量无标注文本上做自监督学习——最典型的方式是「预测下一个词」,模型不断根据上文猜测下一个 Token,猜错了就调整内部参数。经过对天文数字级语料的反复学习,模型逐渐掌握语法、事实知识、逻辑关联甚至编程能力。
如今主流的 AI 大模型几乎都遵循「预训练 + 后训练」范式:预训练赋予模型通用能力,形成所谓「基座模型(Base Model)」;随后再通过指令微调、人类反馈强化学习(RLHF)等手段,把它调教成能听懂指令、安全有用的助手。GPT 的全称 Generative Pre-trained Transformer 中的「P」,指的正是预训练。
预训练是整个流程中最烧钱的环节,需要成千上万张 GPU 连续运行数周甚至数月,因此训练超大模型的能力长期集中在少数科技公司手中,「算力」也成为 AI 竞争的核心资源。
可以把预训练比作「通识教育」,微调比作「岗位培训」。预训练让模型博览群书、打好底子;微调则用少量高质量数据教会它特定技能或行为规范。绝大多数开发者不会自己做预训练,而是在开源或商用基座模型之上做微调(如 LoRA)或直接调用 API,这正是预训练范式带来的分工红利。
问:预训练需要人工标注数据吗?答:基本不需要。预训练采用自监督方式,把「预测下一个词」这类任务直接从原文构造出来;人工标注主要用在后续的微调与对齐阶段。
问:预训练结束后模型就能直接当聊天助手用吗?答:不能。基座模型只擅长续写文本,往往答非所问,需要经过指令微调和 RLHF 等对齐训练后,才能像 ChatGPT、Claude 那样理解并执行指令。
问:普通开发者能自己做预训练吗?答:完整预训练一个大模型的算力和数据成本极高,个人和小团队一般无力承担。更现实的做法是基于开源基座模型做继续预训练或微调,或直接使用现成模型的 API。

| 类型 | 机器学习训练范式 / AI 术语 |
| 所属领域 | 人工智能、深度学习、自然语言处理 |
| 训练方式 | 自监督学习(如预测下一个词) |
| 典型产物 | 基座模型(Base Model) |
| 代表应用 | GPT、Claude、Llama 等大语言模型 |
| 后续阶段 | 指令微调、RLHF 对齐 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧