加载中...

| 类型 | 自然语言处理基本单位 |
| 中文名 | 词元 |
| 英文名 | Token |
| 所属领域 | 人工智能、自然语言处理 |
| 核心用途 | 文本切分、编码与生成 |
Token(词元)是自然语言处理系统将文本切分后用于编码、计算和生成内容的基本单位。
计算机通常不会直接理解完整句子,而是先通过分词器把文本转换为一系列 Token,再将其映射成数字编号和向量。模型据此分析上下文、预测后续 Token,并逐步生成回答。
Token 不一定等同于一个汉字或一个单词。它可能是完整词语、子词、标点、空格或特殊控制符,具体结果取决于模型采用的分词算法和词表。相同文本在不同模型中可能得到不同的 Token 数量。
在人工智能语境中,Token 主要指文本处理单位;在网络安全和软件开发中,Token 还可能指访问令牌、身份凭证或程序语法单元。判断其含义需要结合具体场景。
问:一个 Token 等于一个汉字吗?答:不一定。一个汉字可能对应一个 Token,也可能与相邻字符组合成一个 Token,结果由分词器决定。
问:为什么 Token 数量很重要?答:它会影响模型能读取的上下文范围、可生成内容的长度、响应速度以及部分服务的调用费用。
问:怎样准确计算 Token?答:应使用目标模型对应的分词器或官方计数工具;仅按字数、词数估算可能产生偏差。

| 类型 | 自然语言处理基本单位 |
| 中文名 | 词元 |
| 英文名 | Token |
| 所属领域 | 人工智能、自然语言处理 |
| 核心用途 | 文本切分、编码与生成 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧