加载中...

| 中文名 | 嵌入 |
| 英文名 | Embedding |
| 类型 | 机器学习表示技术 |
| 数据形式 | 稠密数值向量 |
| 应用领域 | 语义搜索、推荐系统、生成式 AI |
嵌入(Embedding)是一种把文字、图片、声音、用户或商品等对象转换为数值向量,使计算机能够比较其含义和关系的表示方法。
在机器学习中,原始对象通常无法直接参与数学运算。嵌入模型会学习一种向量表示,让含义、特征或用途相近的对象在向量空间中彼此接近。例如,“手机”和“智能终端”的文本嵌入通常比“手机”和“蔬菜”更相似。
嵌入并不是对象的简单编号,而是一组由模型生成的连续数值。向量中的单个数值往往没有明确的人类解释,但整体能够编码语义、风格、类别或行为偏好。不同模型生成的向量维度、适用语言和效果可能不同,通常不能直接混用。
嵌入广泛用于语义搜索、推荐系统、文本聚类、分类、去重和异常检测。在生成式 AI 中,文档可先被切分并转换为向量,再存入向量数据库;用户提问时,系统检索相似内容并提供给大语言模型,这种流程常用于检索增强生成。
问:嵌入和关键词搜索有什么区别?答:关键词搜索偏重字面匹配,嵌入搜索可发现表达不同但语义相近的内容,两者也可以组合使用。
问:向量维度越高越好吗?答:不一定。更高维度可能保留更多信息,但也会增加存储和计算成本,实际效果取决于模型与任务。
问:嵌入会包含隐私信息吗?答:嵌入不是原文,但仍可能保留敏感特征,因此需要控制数据来源、访问权限和保存方式。

| 中文名 | 嵌入 |
| 英文名 | Embedding |
| 类型 | 机器学习表示技术 |
| 数据形式 | 稠密数值向量 |
| 应用领域 | 语义搜索、推荐系统、生成式 AI |
登录 后参与讨论
暂无讨论,来发表第一条评论吧