加载中...
大语言模型是在海量文本上训练的超大规模神经网络,能生成、理解、翻译和总结自然语言。GPT-4、Claude、Gemini 等模型正在重塑软件开发、内容创作、客服等行业,参数规模从数十亿到数万亿不等。

| 类型 | 自然语言处理模型 |
| 代表模型 | GPT-4(OpenAI)、Claude 3(Anthropic)、Gemini(Google)、Llama 3(Meta) |
| 基础架构 | Transformer(Vaswani 等,2017) |
所有现代 LLM 的基础都是 2017 年 Google 提出的 Transformer 架构,其核心是自注意力机制(Self-Attention),让模型处理序列时能关注任意位置的上下文,而不像 RNN 那样受限于局部窗口。
2020 年 OpenAI 发表规模定律(Scaling Laws):模型性能随参数量、数据量、计算量的增加呈幂律提升,不存在明显的性能上限。这一发现解释了为什么 GPT-3(1750 亿参数)比 GPT-2(15 亿参数)有质的飞跃,也推动了行业的军备竞赛。[1]
LLM 训练分两阶段:预训练在数万亿 token 的文本上做下一词预测,学习语言知识和世界知识;微调阶段用高质量的指令-响应对调整模型行为,其中 RLHF(人类反馈强化学习)通过人工标注者打分训练奖励模型,再用 PPO 算法让语言模型向高分方向优化——这是 ChatGPT 相较 GPT-3 更「听话」的根本原因。
推理阶段,模型按 token 逐个自回归生成,受限于显存带宽,生成速度通常只有每秒几十个 token。KV 缓存、量化(INT4/INT8)、投机解码(Speculative Decoding)是主要加速手段。

| 类型 | 自然语言处理模型 |
| 代表模型 | GPT-4(OpenAI)、Claude 3(Anthropic)、Gemini(Google)、Llama 3(Meta) |
| 基础架构 | Transformer(Vaswani 等,2017) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧