加载中...

Gensim 是由捷克开发者 Radim Řehůřek 创建的开源 Python 库,口号是「为人类的主题建模」,专注于无监督语义建模,以能流式处理不必载入内存的超大规模语料而闻名。
Gensim 提供 Word2Vec、fastText、Doc2Vec 等词与文档向量模型的高效实现,以及 LSI(潜在语义索引)、LDA(潜在狄利克雷分配)、TF-IDF 等经典主题模型和相似度检索工具。其 Word2Vec 实现经 Cython 优化,是许多研究与工程项目训练词向量的首选。
核心抽象是「语料即可迭代对象」:数据以流式方式逐批进入模型,内存占用与语料规模无关,适合在单机上处理维基百科级别的文本。
常用于文档相似度计算、语义检索、舆情主题发现和推荐系统中的内容表示,是深度学习普及前后长盛不衰的文本挖掘基础设施。

登录 后参与讨论
暂无讨论,来发表第一条评论吧