加载中...

| 中文名 | 交叉编码器 |
| 英文名 | Cross-Encoder |
| 编码方式 | 查询与文档拼接输入 |
| 典型用途 | 重排序 |
| 特点 | 精度高、开销大 |
交叉编码器(Cross-Encoder)是一种用于文本相关性判断的模型结构。它把查询和候选文档拼接成一个整体序列输入到同一个模型中,让两段文本在注意力层里充分交互,最终直接输出一个表示相关程度的分数。由于二者在模型内部深度交互,交叉编码器能捕捉细粒度的语义匹配信息。
与双编码器把查询和文档分别独立编码不同,交叉编码器要求二者必须成对一起送入模型。这带来了更高的匹配精度,但也意味着无法离线预计算文档向量:每来一个新查询,都要把它和每个候选文档重新组合并各跑一次模型。因此交叉编码器计算成本高,难以直接用于对海量文档的一次性检索。
交叉编码器最典型的用途是检索流程中的重排序环节。在稠密检索或 RAG 系统中,先由双编码器等快速召回少量候选文档,再用交叉编码器对这几十个候选逐一精细打分并重新排序,把最相关的内容排到最前,从而在可接受的开销下显著提升最终结果质量。它也用于语义相似度评分等需要高精度的任务。
问:交叉编码器为什么不直接用于全量检索?答:它需要对每个查询-文档对单独推理,面对海量文档计算量过大,延迟不可接受,因此通常只对召回后的少量候选使用。
问:交叉编码器一定比双编码器准吗?答:通常更准,因为二者在模型内充分交互,但代价是速度慢、无法预计算,实际中常与双编码器分工协作。

| 中文名 | 交叉编码器 |
| 英文名 | Cross-Encoder |
| 编码方式 | 查询与文档拼接输入 |
| 典型用途 | 重排序 |
| 特点 | 精度高、开销大 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧