大语言模型(LLM)是基于人工神经网络、拥有海量参数并在大规模文本上训练的语言模型,能理解和生成自然语言,是 ChatGPT、Claude、Gemini 等聊天机器人背后的核心技术。

| 类型 | 人工智能 / 自然语言处理模型 |
| 核心架构 | Transformer(多为生成式预训练 GPT 路线) |
| 训练方式 | 自监督学习 + 指令微调与对齐 |
| 代表模型 | GPT 系列 / Claude / Gemini / Llama |
| 英文名 | Large Language Model (LLM) |
大语言模型(Large Language Model,简称 LLM,也常称「大模型」)是一类基于人工神经网络的语言模型,因参数规模庞大、训练语料海量而得名,专为自然语言处理任务设计,尤其擅长语言生成。
大语言模型通常采用自监督学习方式训练:模型在海量无标注文本上反复练习「预测下一个词」这类任务,逐步掌握语言中的语法、语义和大量常识,无需人工逐条标注数据。预训练完成后,再经过指令微调、人类反馈等对齐环节,模型便能以对话形式回答问题、写作、翻译和辅助编程。
当前主流大语言模型大多基于 Transformer 架构,其中规模最大、能力最强的基本走生成式预训练 Transformer(GPT)路线。ChatGPT、Claude、Gemini、Perplexity 等知名聊天机器人与 AI 搜索产品的核心能力,都由大语言模型提供。部分多模态大模型(如 Gemini、GPT-4o)还能同时处理文字、图片、音频、视频等多种输入。
大语言模型可能产生「幻觉」,即一本正经地编造不存在的事实;其知识止于训练数据的时间范围,对最新事件了解有限;训练与运行成本高,还涉及版权、隐私等争议。在医疗、法律等严肃场景中使用时,仍需人工核查其输出。
问:大语言模型和 ChatGPT 是什么关系?答:ChatGPT 是基于大语言模型构建的聊天机器人产品,LLM 是其底层技术,同类产品还有 Claude、Gemini 等。
问:大语言模型的回答可信吗?答:多数场景下可用,但它可能编造细节,也可能带有训练数据中的偏见,涉及关键事实时应交叉验证。
问:大模型和普通语言模型有何区别?答:主要区别在规模——参数量和训练数据大得多,由此获得了小模型不具备的通用能力和涌现表现。

| 类型 | 人工智能 / 自然语言处理模型 |
| 核心架构 | Transformer(多为生成式预训练 GPT 路线) |
| 训练方式 | 自监督学习 + 指令微调与对齐 |
| 代表模型 | GPT 系列 / Claude / Gemini / Llama |
| 英文名 | Large Language Model (LLM) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧