加载中...

字节对编码(Byte Pair Encoding,BPE)原是 1994 年提出的数据压缩算法,2016 年由 Sennrich 等人引入机器翻译用于子词分词,现已成为大语言模型构建词表的主流方法。
训练阶段从字符(或字节)级词表出发,统计语料中相邻符号对的出现频率,反复将最高频的符号对合并为新符号,直至词表达到目标规模;合并规则按顺序记录。分词阶段对新文本依同样顺序应用合并规则。高频词最终成为单一词元,罕见词被拆为多个子词,兼顾词表大小与未登录词覆盖。
GPT-2 提出字节级 BPE(BBPE),以 256 个字节为初始词表,可无遗漏地表示任意 Unicode 文本,被 GPT 系列、LLaMA 等广泛采用;相关工具有 OpenAI 的 tiktoken、Hugging Face tokenizers。另一路线 SentencePiece 支持 BPE 与 Unigram 两种算法且不依赖预分词。
分词粒度直接影响序列长度、多语言公平性与数字处理能力,是大模型设计中易被忽视却影响深远的环节。

登录 后参与讨论
暂无讨论,来发表第一条评论吧