加载中...

| 类别 | 科技名词 |
| 英文名 | Large Language Model |
| 领域 | 信息技术 |
大语言模型(Large Language Model,LLM)是指在海量文本语料上训练、参数规模通常达数十亿乃至数千亿的神经网络模型。它通过学习语言的统计规律,获得理解、生成、翻译、推理等通用语言能力,能够以自然语言完成多样化任务,是当前生成式人工智能的核心。[1]
主流大语言模型基于Transformer架构,多采用仅解码器结构,以"预测下一个词元(Token)"为基本训练目标,在自监督方式下从无标注文本中学习。其训练通常分阶段:预训练阶段在大规模语料上习得通用知识与语言能力;后训练阶段则通过指令微调与基于人类反馈的强化学习(RLHF)等方法,使模型输出更符合人类意图与价值偏好。推理时,模型依据上下文逐词元生成文本,采样策略影响输出的多样性。模型能力随参数、数据与算力规模扩大而提升,呈现规模定律(Scaling Law)。
大语言模型的优势是通用性强、少样本乃至零样本即可适应新任务、交互自然。其局限包括:可能产生看似合理但不实的"幻觉"内容、知识受训练截止时间限制、推理成本高,以及对偏见与安全风险的敏感性。上下文窗口长度也制约其单次处理的信息量。
大语言模型应用于对话助手、代码生成、文本摘要、信息抽取、内容创作等众多领域,并通过工具调用与检索增强等技术拓展能力边界,成为构建智能体系统的推理核心。

| 类别 | 科技名词 |
| 英文名 | Large Language Model |
| 领域 | 信息技术 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧