加载中...

| 英文名 | Token |
| 类型 | 自然语言处理基本单位 |
| 所属领域 | 人工智能、自然语言处理 |
| 相关过程 | 词元化 Tokenization |
| 常见用途 | 文本编码、模型输入输出、上下文计量 |

词元(Token)是自然语言处理系统表示和处理文本的基本数据单位,可以是一个词、子词、字符、标点或按特定规则切分出的字符串片段。
计算机无法直接理解自然语言,通常需要先通过词元化将文本切分为词元序列,再把每个词元映射为词汇表中的编号,并转换成可供模型计算的向量表示。模型生成回答时,也会逐步预测后续词元,再将结果还原为人类可读的文本。
词元并不总是等同于汉字或完整单词。不同模型采用的词元化算法和词汇表可能不同,因此同一句话在不同系统中得到的词元数量也可能不同。中文文本可能按单字、常见词组或子词切分,英文单词则可能被保留为整体,也可能拆成词根和词缀。
词元化是把原始文本转换为词元序列的过程。常见方法会在词汇覆盖范围、未知内容处理能力和序列长度之间进行平衡。对于代码、多语言文本、罕见词和特殊符号,不同词元化器的处理结果往往差异更明显。
问:一个词元等于一个汉字吗?答:不一定。一个词元可能对应单个汉字、多个汉字,也可能只是标点或某个字符串片段。
问:词元和单词有什么区别?答:单词是语言学概念,词元是模型处理文本时使用的数据单位,两者有时重合,但不能直接画等号。
问:为什么不同模型统计的词元数不同?答:因为各模型使用的词汇表、切分规则和词元化算法可能不同,同一文本会被拆分成不同序列。

| 英文名 | Token |
| 类型 | 自然语言处理基本单位 |
| 所属领域 | 人工智能、自然语言处理 |
| 相关过程 | 词元化 Tokenization |
| 常见用途 | 文本编码、模型输入输出、上下文计量 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧