加载中...
BM25 是一种经典的文本相关性排序算法,基于词频与逆文档频率对查询与文档的匹配度打分,并对文档长度做归一化。它长期是搜索引擎的基线,也常与向量检索组合成混合检索用于 RAG。

| 中文名 | BM25 检索算法 |
| 英文名 | Best Matching 25 |
| 类别 | 文本相关性排序 |
| 理论基础 | 概率检索模型 |
| 典型载体 | Elasticsearch |
BM25(Best Matching 25)是一种基于概率检索模型的文本相关性排序算法。它根据查询词在文档中的词频、词的逆文档频率以及文档长度,计算查询与文档的匹配得分,长期作为搜索引擎和信息检索系统的强基线。
BM25 源于 1990 年代的概率检索理论,是 TF-IDF 思想的改进与集大成者。相比朴素的词频统计,它引入了词频饱和机制,避免某个词出现过多就无限提升得分,同时对文档长度做归一化,防止长文档因包含更多词而占优。凭借简单、高效、无需训练的特点,BM25 至今仍是众多检索系统的默认算法。
BM25 广泛应用于全文搜索引擎、问答系统和文档检索,是 Elasticsearch 等系统的默认打分函数。在检索增强生成中,它常与稠密向量检索结合形成混合检索:BM25 擅长精确匹配关键词,向量检索擅长语义匹配,二者互补可显著提升召回质量。
问:BM25 和向量检索谁更好?答:各有所长。BM25 对精确关键词、专有名词和罕见术语召回强;向量检索理解语义、能匹配同义表达。实践中常将两者融合成混合检索以取长补短。
问:BM25 需要训练吗?答:不需要。它是基于统计的无监督算法,只需对语料建立倒排索引即可使用,部署简单、计算高效,这也是它经久不衰的重要原因。

| 中文名 | BM25 检索算法 |
| 英文名 | Best Matching 25 |
| 类别 | 文本相关性排序 |
| 理论基础 | 概率检索模型 |
| 典型载体 | Elasticsearch |
登录 后参与讨论
暂无讨论,来发表第一条评论吧