词嵌入(Embedding)是自然语言处理中把词语映射为低维实数向量的表征技术,让语义相近的词在向量空间中彼此靠近,是机器理解人类语言、支撑搜索推荐与大语言模型的基础。

| 类型 | 自然语言处理 / 表征学习技术 |
| 所属领域 | 人工智能、机器学习 |
| 代表方法 | Word2Vec、GloVe、fastText |
| 表示形式 | 低维稠密实数向量 |
| 典型应用 | 语义搜索、推荐系统、RAG |
词嵌入(Word Embedding)是自然语言处理(NLP)中的一类表征学习技术,指把词语、短语等语言单位映射为低维连续向量空间中的实数向量,使计算机能够以数值方式表示和比较语义。
计算机无法直接理解文字。早期做法是独热编码(One-Hot),即用一个维度等于词表大小的稀疏向量表示每个词,但这种表示维度极高,且任意两个词之间的距离都相同,无法体现语义关系。词嵌入的核心思想是把这个高维离散空间「嵌入」到一个维数低得多的连续向量空间中,每个词对应一个稠密向量。
词嵌入通常基于「分布假设」——上下文相似的词,语义也相似。模型通过在大规模语料上学习词与上下文的共现规律,让语义相近的词(如「猫」和「狗」)在向量空间中距离更近,甚至能通过向量运算刻画类比关系。代表性方法包括 Word2Vec、GloVe、fastText 等;后来的 BERT、GPT 等预训练模型则进一步发展出随上下文动态变化的嵌入表示。
词嵌入及其推广形式(句子嵌入、文档嵌入)广泛用于语义搜索、推荐系统、文本分类、机器翻译和问答系统。在大语言模型时代,嵌入还是检索增强生成(RAG)和向量数据库的基础:先把文档转成向量存储,再按语义相似度检索出相关内容供模型参考。
问:词嵌入和独热编码有什么区别?答:独热编码是高维稀疏向量,词与词之间没有语义关联;词嵌入是低维稠密向量,能让语义相近的词在空间中距离更近。
问:Embedding 只针对词语吗?答:不是。同样的思想可以推广到句子、文档、图片、商品、用户等各种对象,统称为嵌入表示,是现代推荐与检索系统的通用技术。
问:词嵌入和大语言模型是什么关系?答:大语言模型内部就以嵌入向量作为文字的基本表示;同时专门的嵌入模型常与大模型配合,用于语义检索和 RAG 等场景。

| 类型 | 自然语言处理 / 表征学习技术 |
| 所属领域 | 人工智能、机器学习 |
| 代表方法 | Word2Vec、GloVe、fastText |
| 表示形式 | 低维稠密实数向量 |
| 典型应用 | 语义搜索、推荐系统、RAG |
登录 后参与讨论
暂无讨论,来发表第一条评论吧