加载中...

中文分词是将没有天然空格分隔的连续汉字序列切分成词序列的技术。由于中文词边界不显式存在,分词是中文信息检索、文本挖掘与自然语言处理的前置基础步骤。
主要方法经历三个阶段:基于词典的机械匹配(正向/逆向最大匹配),简单快速但无法处理未登录词;基于统计模型,如隐马尔可夫模型、条件随机场(CRF),将分词转化为序列标注问题;基于深度学习,用 BiLSTM、BERT 等模型进一步提升对歧义与新词的处理能力。
典型难点包括切分歧义("研究生命"可切为"研究/生命"或"研究生/命")、未登录词(人名、新词、网络用语)以及不同场景对切分粒度的不同要求。
搜索引擎建立倒排索引前必须分词,粒度直接影响召回与精度;常用开源工具包括 jieba、HanLP、IK Analyzer、THULAC 等。

登录 后参与讨论
暂无讨论,来发表第一条评论吧