📘 从零开始理解大模型:Tokenizer → 向量 → RAG(小白超详细版)


🧠 0. 你先要理解:大模型到底在干嘛?

一句话:

大模型 = 把“文字”变成“数字”,再用数学方法理解语义


🌍 1. 为什么计算机看不懂中文?

计算机只懂:

  • 数字
  • 向量
  • 矩阵

例如:

❌ 我喜欢苹果(机器不懂)
✔ [1001, 1002, 1003](机器可以处理)


✂️ 2. Tokenizer:第一步“切词工具”

2.1 Tokenizer是什么?

Tokenizer = 把文字切成“最小语义单位”的工具

例如:

我喜欢苹果

可能变成:

我 / 喜欢 / 苹果

2.2 常见切法

✔ 按字切

我 / 喜 / 欢 / 苹 / 果

✔ 按词切

我 / 喜欢 / 苹果

✔ 子词切(最常见)

我 / 喜 / 欢 / 苹果

我 / 喜欢 / 苹 + 果

✔ Byte级(GPT)

按字节拆分

👉 优点:不会出现“生僻字无法处理”


📚 3. Vocab词表:机器的“字典”

3.1 什么是vocab?

vocab = token ↔ 数字 的映射表

例如:

我 → 1001
喜欢 → 1002
苹果 → 1003

3.2 本质理解

👉 vocab 就是一本“翻译字典”


3.3 vocab怎么来的?

不是人工写的,而是:

Step1:收集大量文本

我喜欢苹果
你喜欢香蕉

Step2:统计常见词

喜欢 出现很多次
苹果 出现很多次

Step3:生成词表

喜欢 → token
苹果 → token

Step4:分配编号(token id)

喜欢 → 1002
苹果 → 1003

🔢 4. Token ID:只是“编号”

4.1 定义

token id = vocab里的数字编号

苹果 → 1003

4.2 重点

❌ 没有语义
❌ 不代表“苹果的意思”
✔ 只是索引


4.3 类比

学号学生
1001张三

👉 学号 ≠ 人的能力
👉 token id ≠ 语义


🧩 5. Embedding:语义向量

5.1 为什么需要它?

数字没意义:

1001 1002 1003

所以要变成:

[0.12, -0.33, 0.77, ...]

5.2 这个东西叫:

👉 embedding(词向量)


5.3 本质

embedding = 一个“查表矩阵”

token id → 向量

5.4 举例

苹果 → [0.2, -0.7, 0.33 ...]
香蕉 → [0.21, -0.69, 0.31 ...]
汽车 → [-0.9, 0.1, 0.4 ...]

5.5 语义规律

  • 苹果 ≈ 香蕉(接近)
  • 苹果 ≠ 汽车(远)

📏 6. 余弦相似度:判断像不像

6.1 是什么?

用来判断两个向量是否相似

cos(A, B)

6.2 结果范围

含义
1完全相似
0无关
-1完全相反

6.3 用途

  • 语义搜索
  • 推荐系统
  • RAG检索

📦 7. Chunk分块:为什么要切文档?

7.1 问题

如果不分块:

一整篇文档太长 → 模型无法精准理解


7.2 解决方案

把文档拆成小块:

chunk1:请假制度
chunk2:报销制度
chunk3:考勤制度

7.3 为什么重要?

因为:

👉 检索的是“块”,不是“整篇文章”


7.4 chunk太大 vs 太小

太大:

❌ 语义混乱

太小:

❌ 没上下文


7.5 推荐

500 tokens + overlap 100

🗄️ 8. 向量数据库

用来存:

chunk → embedding

常见:

  • Milvus
  • Pinecone
  • Qdrant
  • Weaviate
  • pgvector

功能:

  • 存向量
  • 相似度搜索
  • ANN加速

🤖 9. RAG:最重要的部分

9.1 是什么?

RAG = 检索 + 生成


9.2 为什么需要?

因为大模型:

  • 不知道私有数据
  • 知识可能过时
  • 会“胡说”

9.3 工作流程

用户问题
   ↓
转向量
   ↓
向量数据库搜索
   ↓
找到相关chunk
   ↓
拼prompt
   ↓
大模型回答

9.4 举例

问题:

病假需要什么材料?

系统:

  1. 找“病假相关chunk”
  2. 拼给模型
  3. 模型回答

9.5 本质

👉 RAG = 给大模型“外挂知识库”


🧠 10. 全链路总结(非常重要)

中文文本
  ↓
Tokenizer(切词)
  ↓
Token
  ↓
Vocab(查表)
  ↓
Token ID
  ↓
Embedding(向量)
  ↓
语义空间
  ↓
Cosine相似度
  ↓
Chunk检索
  ↓
RAG
  ↓
大模型回答

🚀 11. 一句话终极总结

大模型不是“记住知识”,而是“把文字变成向量,在空间中找相似,再生成答案”

更多推荐