加载中...

TF-IDF(Term Frequency-Inverse Document Frequency,词频-逆文档频率)是信息检索与文本挖掘中的经典特征加权方法,用于评估一个词对语料库中某篇文档的重要程度。
TF(词频)衡量词在当前文档中出现的频繁程度;IDF(逆文档频率)衡量词的区分能力,计算方式为语料文档总数除以包含该词的文档数再取对数。两者相乘,使得在本文档中频繁出现、但在整个语料中少见的词获得高权重,而「的」「是」等到处出现的词权重趋近于零。
TF-IDF 是搜索引擎相关性排序的基础思想之一,后续的 BM25 即在其基础上改进;它也常用于将文本转为向量以进行分类、聚类,以及关键词自动抽取。
TF-IDF 基于词袋假设,忽略词序和语义,无法识别同义词;在短文本上统计量不足,效果受限,如今常与词向量或预训练模型互补使用。

登录 后参与讨论
暂无讨论,来发表第一条评论吧