加载中...
Token 是大语言模型处理文本的基本单位,介于字符与单词之间。GPT-4 处理一段英文时,大约每 4 个字符对应 1 个 token,中文则通常每字对应 1-2 个 token,直接决定模型上下文长度和 API 调用成本。

| 类型 | NLP 基础概念 |
| 相关算法 | BPE、WordPiece、Unigram LM |
| 典型词表大小 | 32,000 – 100,352 个 token |
Token 不等于单词,也不等于字符,而是分词器(Tokenizer)切分文本后得到的最小语义单元。以英文为例,"unhappiness" 可能被切成 "un"、"happiness" 两个 token;"ChatGPT" 则可能是整体一个 token。OpenAI 的 GPT 系列用的是 BPE(Byte Pair Encoding)算法,中文每个汉字通常占 1-2 个 token,日语假名则更多。
Token 数量直接影响两件事:一是模型能「记住」多长的上下文(GPT-4 Turbo 上限 128K token,约合 30 万英文单词);二是 API 费用,OpenAI 按 token 计费,输入和输出单价不同。[1]
用单个字符太碎,词表会很小但序列极长,模型学不到词义;用完整单词则词表会膨胀到几十万,生僻词和新词无法处理。BPE 是折中方案:先从字符级别出发,把高频字符组合合并成子词单元,最终词表控制在 3 万到 10 万左右。GPT-2 词表 50,257 个 token,LLaMA 2 用 32,000 个,Claude 的 tokenizer 与 GPT 不同,同样的文本 token 数会有差异。
实际影响:向 API 传一段中文提示词,token 数往往比你预期多,因为中文标点、空格都额外占 token。很多开发者会用 tiktoken 库提前估算费用。

| 类型 | NLP 基础概念 |
| 相关算法 | BPE、WordPiece、Unigram LM |
| 典型词表大小 | 32,000 – 100,352 个 token |
登录 后参与讨论
暂无讨论,来发表第一条评论吧