加载中...

SentencePiece 是 Google 开源的子词分词工具库,以 C++ 实现并提供 Python 接口。它把文本视为原始 Unicode 字符流(空格也编码为特殊符号),不依赖任何语言特定的预切分规则,因此对中文、日文等无空格语言尤其友好。
支持 BPE 和 Unigram 语言模型两种子词算法;分词与还原完全可逆,保证「解码后与原文一致」;词表、合并规则和归一化规则打包为单一模型文件,便于跨框架部署。
T5、Llama、ALBERT、mT5 以及众多多语言模型使用 SentencePiece 训练分词器。在大模型工程中,它常与 Hugging Face tokenizers 库配合,是构建自定义词表、扩充中文词元时的常用工具。

登录 后参与讨论
暂无讨论,来发表第一条评论吧