加载中...

| 类型 | 自然语言处理与表征学习技术 |
| 所属领域 | 人工智能、机器学习 |
| 表示对象 | 词语、子词或词元 |
| 表示形式 | 连续稠密向量 |
| 英文名 | Word Embedding |
| 常见用途 | 语义搜索、文本分类、语言模型 |
词嵌入(Embedding)是一种把词语、子词或其他语言单位映射为连续数值向量的自然语言处理表示方法。
计算机不能直接理解文字,通常需要先将文本转换成可计算的数字。传统独热编码会为每个词分配一个彼此独立的高维向量,难以表达词语之间的联系;词嵌入则用维度较低的稠密向量表示语言单位,使含义或使用环境相近的词在向量空间中通常也更接近。
词嵌入一般通过大规模文本训练获得,模型会根据词语的上下文、共现关系或预测任务调整向量。向量本身不等同于人类给出的词义定义,但可以承载语义、语法和使用习惯等统计信息,供机器学习模型进一步处理。
词嵌入常用于语义搜索、文本分类、情感分析、机器翻译、对话系统和大型语言模型。实际系统还会使用句子嵌入或文档嵌入表示更长文本。其效果受训练语料、分词方式和模型结构影响,也可能继承语料中的偏见;向量相近通常表示统计关联,并不必然代表事实正确或含义完全相同。
问:词嵌入和独热编码有什么区别?答:独热编码只表示词的身份,向量之间缺少语义关系;词嵌入通过训练获得连续表示,能反映一定的相似性。
问:Embedding只能表示单词吗?答:不能。它也可用于子词、句子、文档、图片及其他对象,但表示文本中单词或词元时通常称为词嵌入。
问:向量维度越高越好吗?答:不一定。更高维度可能容纳更多信息,但也会增加计算和存储成本,需结合数据规模与任务选择。

| 类型 | 自然语言处理与表征学习技术 |
| 所属领域 | 人工智能、机器学习 |
| 表示对象 | 词语、子词或词元 |
| 表示形式 | 连续稠密向量 |
| 英文名 | Word Embedding |
| 常见用途 | 语义搜索、文本分类、语言模型 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧