人工智能与大模型专业术语
AI术语梯度下降是训练神经网络的核心优化算法,沿着损失函数梯度的反方向迭代更新参数,逐步找到让损失最小的权重组合。Adam、SGD 等都是梯度下降的变体,每天都在数据中心的 GPU 集群上运行数以亿计的迭代。
AI术语反向传播算法利用链式法则高效计算神经网络所有参数的梯度,是深度学习训练的数学基础。没有反向传播,就没有深度神经网络的大规模训练,也不会有今天的 AI 浪潮。
AI术语知识蒸馏让小模型(学生)通过模仿大模型(教师)的输出分布来学习,而非直接从硬标签训练,使小模型在参数大幅减少的情况下保留教师模型大部分性能。DistilBERT、TinyBERT 都是蒸馏的经典产物。
AI术语注意力机制让神经网络在处理每个词时动态聚焦于输入序列中最相关的部分,而非平均对待所有信息。Transformer 架构的核心就是多头自注意力,它让 GPT、BERT 等大模型成为可能。
AI术语Token 是大语言模型处理文本的基本单位,介于字符与单词之间。GPT-4 处理一段英文时,大约每 4 个字符对应 1 个 token,中文则通常每字对应 1-2 个 token,直接决定模型上下文长度和 API 调用成本。
AI术语LSTM(Long Short-Term Memory,长短期记忆网络)通过引入遗忘门、输入门和输出门,解决了 RNN 梯度消失问题,让网络真正能记住长距离依赖。它在 2015-2018 年间几乎主导了序列建模的所有任务。
AI术语损失函数量化模型预测与真实标签之间的差距,是训练目标的数学表达。选对损失函数对模型性能至关重要:分类用交叉熵、回归用均方误差、生成模型有其专属设计,而 RLHF 的奖励模型本质上也是一种特殊的损失设计。
AI术语过拟合指模型在训练数据上表现极好,但在新数据上泛化性能差,本质是模型把训练集的噪声和偶然规律当成真实模式来学习了。它是机器学习实践中最常见的问题之一,防止过拟合贯穿整个模型设计流程。
AI术语AI Agent 是能够自主规划、使用工具、执行多步任务的 AI 系统,不再是单次问答,而是像一个助手一样分解目标、调用搜索/代码执行/文件系统等工具,循环迭代直到完成任务。AutoGPT、Claude Computer Use、OpenAI Assistants API 是代表性实现。
AI术语GAN(Generative Adversarial Network)由生成器和判别器组成,两者相互博弈:生成器学着造假数据以骗过判别器,判别器学着识破假货。这种对抗训练机制让 GAN 能生成极度逼真的图像、视频和音频。
AI术语多模态模型能同时理解和生成多种数据类型(文本、图像、音频、视频),而非局限于单一模态。GPT-4V、Gemini 1.5 Pro、Claude 3 Opus 都是多模态大模型,它们重新定义了 AI 助手的交互方式。
AI术语上下文窗口是大语言模型一次处理的最大 token 数量,决定了模型能「记住」多少内容。从 GPT-2 的 1024 token,到 GPT-4 Turbo 的 128K,再到 Gemini 1.5 Pro 的 100 万 token,上下文长度的扩展正在重塑 AI 应用的可能边界。
AI术语RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)通过收集人类对模型输出的偏好评分来训练奖励模型,再用强化学习优化语言模型,使其输出更符合人类期望。ChatGPT 的「对齐」很大程度上依赖于 RLHF。
AI术语Embedding 是将离散符号(单词、图片、用户 ID)映射到连续高维向量空间的技术。语义相近的词在向量空间中距离更近,这一性质让神经网络可以做相似度计算、推荐、检索等任务。
AI术语强化学习让智能体通过与环境交互、获取奖励信号来学习最优策略,无需人工标注数据。AlphaGo、ChatGPT 的 RLHF 对齐、OpenAI Five 打败职业 Dota2 选手,都是强化学习的代表性成果。
AI术语借鉴操作系统分页思想管理KV缓存的注意力实现,消除显存碎片,vLLM高吞吐的核心技术。
AI术语限制每个词只关注邻近固定窗口的稀疏注意力,将复杂度降为线性,Mistral等模型采用。
AI术语通过拉近相似样本、推远不相似样本来学习表示的方法,代表工作有 SimCLR、MoCo、CLIP。
AI术语量化(Quantization)将神经网络的权重和激活从高精度浮点数(FP32/FP16)压缩为低比特整数(INT8/INT4/甚至 INT2),大幅降低模型显存占用和推理延迟,是让大模型在消费级硬件上运行的关键技术。
AI术语将句子解析为词与词之间依存关系树的句法分析方法,揭示主谓、动宾等语法结构。