上一轮工业革命已成历史,
这一轮智能革命正在眼前。
这一次,不做旁观者,做深度参与者。
关注我,一起学习大模型。

一、原理基础-何为token

Token是大语言模型处理文本的基本单位,不是简单的字符或单词,而是通过算法将文本分割成的语义片段。我们也可以叫词元。

英文:"ChatGPT is amazing!"
Tokens: ["Chat", "G", "PT", " is", " amazing", "!"]

中文:"深度学习"
Tokens: ["深", "度", "学", "习"]["深度", "学习"](取决于分词)

代码:def calculate():
Tokens: ["def", " calculate", "():"]

和web系统的token啥区别

大语言模型的Token
本质:文本处理单元
作用:将自然语言转换为模型能处理的数字表示
类比:就像人类语言中的“单词”或“字”
位置:存在于模型内部处理流程中

Web网站的Token
本质:身份验证令牌
作用:验证用户身份和授权访问权限
类比:就像现实中的“身份证”或“门票”
位置:存在于网络请求的HTTP头部

为什么起个容易歧义的名称

30年前大模型这条分支就叫token了,只是我们不了解不关注,现在大模型如火如荼,我们先知道web的token,现在才知道大模型的token,所以会有点疑惑

      计算机科学中的Token概念
           /                  \
          /                    \
"词法分析Token"             "安全凭证Token"
(编译原理)               (网络安全)
     ↓                          ↓
大语言模型Token              Web Token
(文本处理单位)            (身份令牌)

二、token的处理过程

原始文本 → Unicode编码 → 分词算法 → Token IDs → 模型处理

分词算法有很多,模型也有各自的token库,分完词之后,会去和token库理对比,转换成对应的id
比如下面

原始文本 → 分词算法 → Token序列 → 查找词汇表 → Token IDs → 模型处理
     ↓           ↓           ↓           ↓           ↓         ↓
   "Hello world!"["Hello", " world", "!"][15496, 995, 0] → 模型输入

三 常用模型的token库

每个模型都有自己的tokens库,看几个常见的

特性 通义千问 (Qwen) DeepSeek-V3 GPT-4
分词方法 字节级BPE 字节级BPE 字节级BPE (cl100k_base)
词汇表大小 约15.2万 约12.8万 10万
核心特点 中英双语优化 高效混合专家架构 技术细节未完全公开
语言侧重 中文、英文及多语言 中文、英文及代码 英文、代码及多语言

十几万看起来不大,但其实也差不多了

  1. 常用汉字只有约3500个
  2. 常用英文单词约3-5万个
  3. 学术、技术词汇约5-10万个
  4. 剩下的就是组合和特殊token

更多推荐