加载中...

jieba(结巴分词)是 GitHub 上最流行的开源中文分词 Python 库,由 fxsjy 发起,以简单易用著称,长期是中文文本处理入门的事实标准工具。
jieba 基于前缀词典构建句子的有向无环图(DAG),用动态规划查找最大概率路径确定基本切分;对词典中不存在的未登录词,采用基于汉字成词能力的 HMM 模型配合维特比算法进行识别。
提供三种模式:精确模式适合文本分析;全模式列出所有可能成词;搜索引擎模式对长词再切分以提高召回。此外支持自定义词典、词性标注、基于 TF-IDF 与 TextRank 的关键词抽取,以及并行分词。
jieba 拥有 Java、Go、Rust、Node.js、PHP 等多语言移植版本,常与 Elasticsearch、Solr 等搜索引擎配合使用。虽然精度不及深度学习分词器,但胜在零依赖、速度快、部署简单。

登录 后参与讨论
暂无讨论,来发表第一条评论吧