大模型知识之Token
·
上一轮工业革命已成历史,
这一轮智能革命正在眼前。
这一次,不做旁观者,做深度参与者。
关注我,一起学习大模型。
一、原理基础-何为token
Token是大语言模型处理文本的基本单位,不是简单的字符或单词,而是通过算法将文本分割成的语义片段。我们也可以叫词元。
英文:"ChatGPT is amazing!"
Tokens: ["Chat", "G", "PT", " is", " amazing", "!"]
中文:"深度学习"
Tokens: ["深", "度", "学", "习"] 或 ["深度", "学习"](取决于分词)
代码:def calculate():
Tokens: ["def", " calculate", "():"]
和web系统的token啥区别
大语言模型的Token
本质:文本处理单元
作用:将自然语言转换为模型能处理的数字表示
类比:就像人类语言中的“单词”或“字”
位置:存在于模型内部处理流程中
Web网站的Token
本质:身份验证令牌
作用:验证用户身份和授权访问权限
类比:就像现实中的“身份证”或“门票”
位置:存在于网络请求的HTTP头部
为什么起个容易歧义的名称
30年前大模型这条分支就叫token了,只是我们不了解不关注,现在大模型如火如荼,我们先知道web的token,现在才知道大模型的token,所以会有点疑惑
计算机科学中的Token概念
/ \
/ \
"词法分析Token" "安全凭证Token"
(编译原理) (网络安全)
↓ ↓
大语言模型Token Web Token
(文本处理单位) (身份令牌)
二、token的处理过程
原始文本 → Unicode编码 → 分词算法 → Token IDs → 模型处理
分词算法有很多,模型也有各自的token库,分完词之后,会去和token库理对比,转换成对应的id
比如下面
原始文本 → 分词算法 → Token序列 → 查找词汇表 → Token IDs → 模型处理
↓ ↓ ↓ ↓ ↓ ↓
"Hello world!" → ["Hello", " world", "!"] → [15496, 995, 0] → 模型输入
三 常用模型的token库
每个模型都有自己的tokens库,看几个常见的
| 特性 | 通义千问 (Qwen) | DeepSeek-V3 | GPT-4 |
|---|---|---|---|
| 分词方法 | 字节级BPE | 字节级BPE | 字节级BPE (cl100k_base) |
| 词汇表大小 | 约15.2万 | 约12.8万 | 10万 |
| 核心特点 | 中英双语优化 | 高效混合专家架构 | 技术细节未完全公开 |
| 语言侧重 | 中文、英文及多语言 | 中文、英文及代码 | 英文、代码及多语言 |
十几万看起来不大,但其实也差不多了
- 常用汉字只有约3500个
- 常用英文单词约3-5万个
- 学术、技术词汇约5-10万个
- 剩下的就是组合和特殊token
更多推荐
所有评论(0)