加载中...

字节对编码(Byte Pair Encoding,BPE)原本是一种数据压缩算法,后被引入自然语言处理用于子词切分。它从字符(或字节)级别出发,统计语料中最高频的相邻符号对并合并为新符号,迭代至达到预设词表大小。
BPE 在词级与字符级之间取得平衡:高频词保留为完整词元,低频词拆成若干子词,从而在有限词表下消除未登录词问题。GPT-2 提出的字节级 BPE(BBPE)直接以 256 个字节为初始词表,可无遗漏地表示任意 Unicode 文本。
GPT 系列、Llama、DeepSeek 等绝大多数大语言模型的分词器基于 BPE 或其变体。词表设计直接影响模型的压缩率与多语言能力:中文等非拉丁语言若词表覆盖不足,同样文本会消耗更多 token,增加推理成本。

登录 后参与讨论
暂无讨论,来发表第一条评论吧