加载中...

| 类别 | 科技名词 |
| 英文名 | Vector Database |
| 领域 | 信息技术 |
向量数据库(Vector Database)是专门用于存储、索引和检索高维向量(嵌入,Embedding)的数据库系统。它以"相似度"而非精确匹配为查询核心,能够在海量向量中快速找出与目标向量语义最相近的若干项,是支撑语义搜索与检索增强生成等人工智能应用的关键基础设施。[1]
文本、图像等非结构化数据先经由嵌入模型转换为高维向量,语义相近的数据在向量空间中距离相近。向量数据库通过近似最近邻(ANN)算法实现高效检索,常见索引结构包括HNSW(分层可导航小世界图)、IVF(倒排文件)及乘积量化(PQ)等。相似度通过余弦相似度、欧氏距离或内积等度量衡量。为在精度与速度间取得平衡,向量数据库通常采用"近似"检索,牺牲少量召回率以换取数量级的性能提升,并支持向量与结构化元数据的混合过滤查询。
其优势在于对高维相似度检索的高效支持、良好的水平扩展能力与对语义查询的原生支持。需要权衡的方面包括:近似检索带来的召回率取舍、索引构建与内存开销,以及嵌入质量对检索效果的决定性影响。
向量数据库广泛用于检索增强生成(RAG)、语义搜索、推荐系统、图像与音频检索、异常检测等场景。代表性系统包括Pinecone、Milvus、Weaviate以及PostgreSQL的pgvector扩展。

| 类别 | 科技名词 |
| 英文名 | Vector Database |
| 领域 | 信息技术 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧