加载中...

稠密检索(Dense Retrieval)是用神经网络将查询与文档分别编码为低维稠密向量,再以向量内积或余弦相似度进行召回的检索范式,与基于倒排索引的稀疏检索(如 BM25)相对。
典型架构为双塔(bi-encoder):两个共享或独立的 Transformer 编码器分别处理查询和文档,训练时用对比学习拉近相关对、推远不相关对,难负例挖掘是效果关键。代表工作 DPR(Dense Passage Retrieval)证明了稠密检索在开放域问答上可超越 BM25。文档向量离线算好存入向量索引,在线只需编码查询并做 ANN 搜索。
稠密检索是 RAG 系统召回层的主流方案,也用于搜索引擎语义召回、问答匹配与推荐。
优点是能匹配同义与语义改写、不受词面限制;缺点是对领域外数据泛化较弱、难以精确匹配罕见实体与数字,工程上常与 BM25 组成混合检索互补。

登录 后参与讨论
暂无讨论,来发表第一条评论吧