加载中...
| 类别 | AI术语 |
| 英文名 | Tokenizer |
| 领域 | 人工智能 |
Token(词元)是自然语言处理中模型处理文本的最小基本单元。语言模型并不直接处理原始字符串,而是先由分词器(Tokenizer)将文本切分为一系列 Token,再将每个 Token 映射为整数索引输入模型。Token 可以是一个完整单词、词的一部分(子词)、单个字符或标点符号,其粒度取决于所采用的分词算法。[1]
现代大模型普遍采用子词分词算法,主流方法包括字节对编码(BPE)、WordPiece 与 Unigram。以 BPE 为例,它从字符级词表出发,统计语料中相邻符号对的共现频率,迭代合并高频对,逐步构建出涵盖常见词与子词的词表。这种策略在词表规模与序列长度之间取得平衡:高频词被表示为单一 Token,低频词或未登录词则被拆分为多个子词,从而有效缓解未登录词(OOV)问题。每个 Token 经嵌入层转换为稠密向量参与后续计算。
Token 是衡量模型处理能力与成本的基本计量单位。上下文窗口长度、计费定价、生成速度均以 Token 计量。中文等表意文字通常一字对应一至多个 Token,而英文一个单词可能被拆为若干子词,因此相同字符数下不同语言的 Token 数差异显著。分词方式直接影响模型对词汇语义与形态的建模效率。
理解 Token 机制对实际使用至关重要:它决定了提示词的长度预算、长文本处理时的截断策略以及 API 调用成本估算。开发者常借助 Token 计数工具预估开销,并通过精简提示、压缩上下文等手段在有限的 Token 预算内优化模型表现。
| 类别 | AI术语 |
| 英文名 | Tokenizer |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧