加载中...

| 类型 | 自然语言处理与表征学习技术 |
| 英文名 | Word Embedding |
| 表示对象 | 单词、词组或子词 |
| 输出形式 | 稠密实数向量 |
| 常见方法 | Word2Vec、GloVe、FastText |
| 主要用途 | 语义计算与文本建模 |
词嵌入是一类把单词、词组或子词映射为连续实数向量的自然语言处理技术,使计算机能够用数学方式表示和比较语言。
传统独热编码通常为词表中的每个词分配一个高维稀疏向量,不仅占用空间,也难以直接表达词语之间的语义联系。词嵌入则把离散符号投射到维度较低的稠密向量空间,让含义或使用环境相近的词在空间中通常更接近。
词向量可以通过预测上下文、统计词语共现关系或训练神经网络获得。Word2Vec、GloVe 和 FastText 是常见的静态词嵌入方法;现代语言模型还会生成上下文化表示,使同一个词在不同句子中得到不同向量,更好地处理一词多义。
静态词嵌入难以根据语境改变词义,并可能遇到未登录词问题;训练语料中的偏见也可能被编码进向量。上下文化词嵌入改善了语境理解,但通常需要更多计算资源,其向量含义也不容易直接解释。
问:词嵌入和词向量一样吗?答:日常语境中两者常被混用,但词嵌入更侧重映射方法或表示机制,词向量通常指映射后得到的具体数值结果。
问:词嵌入的维度越高越好吗?答:不一定。更高维度可能容纳更多信息,但也会增加计算成本和过拟合风险,应结合语料规模与任务需求选择。
问:词嵌入能直接理解语言吗?答:不能。它只是语言的数值表示,需要与模型结构、训练数据和具体任务配合使用。

| 类型 | 自然语言处理与表征学习技术 |
| 英文名 | Word Embedding |
| 表示对象 | 单词、词组或子词 |
| 输出形式 | 稠密实数向量 |
| 常见方法 | Word2Vec、GloVe、FastText |
| 主要用途 | 语义计算与文本建模 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧