加载中...
| 类别 | AI术语 |
| 英文名 | Embedding |
| 领域 | 人工智能 |
嵌入(Embedding)是指将单词、句子、图像、用户、商品等离散或高维对象映射为连续、稠密的低维实数向量的表示方法。其核心目标是让语义或功能相近的对象在向量空间中彼此邻近,从而将抽象的语义关系转化为可计算的几何距离,为下游机器学习任务提供高质量的特征表示。[1]
嵌入的本质是学习一个从原始对象空间到向量空间的映射函数。在自然语言处理中,早期的 Word2Vec、GloVe 基于分布假说——「词义由其上下文决定」——通过预测上下文或共现统计学习词向量,使语义相关的词向量靠近。现代方法则借助 Transformer 编码器生成上下文相关的动态嵌入,同一词在不同语境下拥有不同表示。句子与文档级嵌入常通过对比学习训练,使语义相似的文本对在空间中聚拢。向量间的相似度通常以余弦相似度或欧氏距离度量。
嵌入的优势在于:维度紧凑、计算高效,能够捕捉复杂的语义与类比关系(如著名的「国王-男人+女人≈王后」向量运算)。它将符号化信息转化为神经网络易于处理的连续表示。其局限包括:嵌入质量高度依赖训练数据与目标,可能继承数据中的偏见;静态嵌入难以处理一词多义;且向量的可解释性较弱。
嵌入是现代 AI 系统的基础组件,广泛用于语义检索、推荐系统、聚类分析、文本分类与去重。在检索增强生成(RAG)中,文档与查询被编码为嵌入向量,借助向量数据库进行相似度检索以召回相关知识。多模态嵌入更将文本与图像统一至同一空间,支撑跨模态检索与生成,是连接异构数据的关键桥梁。
| 类别 | AI术语 |
| 英文名 | Embedding |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧