核心概括

Token 并不是底层无关紧要的技术名词,而是使用大模型里的核心基础单元,左右着费用、推理速度、可容纳的对话上下文上限三大关键指标,下面拆开通俗解释:

1. 调用成本

大模型厂商计费规则普遍按照 token 数量计价:输入的提示词(问题、历史对话)和模型输出的回答全部折算成 token。英文大约 4 个字符≈1token;中文大致 1‑2 个汉字占 1 个 token。 内容越长,token 越多,花钱越多。 举例子:冗长冗余的历史对话、多余注释、无效描述会无谓消耗 token,拉高开销;精简 Prompt 可以节约使用成本。

2. 生成速度

模型是逐个 token 依次输出文字。

  1. 模型每秒能生成的 token 数量有上限;token 总量越大,等待回复时间越长。
  • 精简指令:输出 token 变少,回复更快;
  • 长篇输出:上千 token 就会明显感觉到打字节奏变慢。 同时输入侧 token 过多,也会加重模型预处理负担,同样拖慢整体响应。

3. 上下文窗口(Context‑Window)

每一款大模型都规定了最大 token 上限,也就是上下文窗口。窗口包含两部分:历史聊天内容 + 你的最新提问 + AI 后续回答。 一旦全部 token 总和超过上限:

  1. 旧对话会被模型自动遗忘;
  2. 直接报错无法调用; 窗口大小本质就是 token 配额决定。 比如 128k 上下文模型,就是最多支持约十几万 token 的内容。

延伸深层逻辑(实践层面)

  1. 优化 token 是工程层面的必修课:做 Agent、RAG 知识库、长期对话机器人时,工程师会做摘要、压缩历史对话、剔除无用文本,目的就是节省 token;
  2. 模型选型的取舍:超大上下文版本的模型单价更高;如果业务文本不长,选用小上下文版本性价比更高;
  3. 对普通使用者启示:日常和 AI 对话,不用堆砌废话,既能省 token、回复更快,模型也不容易丢失前面的对话内容。

速度是第二个关键因素。大模型一次仅生成一个 Token,这就是我们之前讲过的下一词预测机制。模型回复里的 Token 数量越多,等待时间就越久。

通俗理解这段话

  1. 核心原理:大模型采用逐 Token 串行输出(下一词预测),它没办法一次性把整段文字全部算出来,每一回只推理生成 1 个 Token,接着依托已经产出的内容再推算下一个。
  2. 时延逻辑: 一段回答拆分后的 Token 越多,模型就要循环执行多少次计算;硬件算力上限固定时,Token 总量越大,用户等待回复的耗时越长。
补充细节
  • 中英文换算:大致 1 个中文汉字约等于 2 个 Token,英文单词大多 1 个单词对应 1‑2 个 Token;
  • 现实痛点: 就算 GPU 算力很强,串行生成的固有特性没办法彻底消除延迟,这也是为什么长回答输出缓慢;现在业界采用批量推理、投机解码、KV‑Cache 等技术,用来减少生成耗时。

每一个大语言模型(LLM)都有一次性能够处理的 token 上限,这就是上下文窗口。它既包含你的输入内容,也涵盖模型生成的回复内容。

核心理解

  1. Token 释义 Token 是大模型里文本的基本计量单位,英文里大致 4 个字母≈1 个 token;中文通常 1‑2 个汉字算作 1 个 token,标点、空格同样会占用 token 配额。
  2. 上下文窗口(Context Window) 上下文窗口 = 该模型单次会话全部可用 token 的最大值,输入提问 + 模型输出回答全部消耗窗口额度。 举个例子:一款模型上下文窗口为 8k‑token。
  • 你发问题用掉 3000token,那么模型后续最多只能输出 5000token;
  • 当历史对话累积的 token 快要占满上限时,就会出现两种情况: ① 旧对话内容被模型自动截断遗忘,它看不到很早之前的聊天; ② 直接报错,提示上下文长度超限。

两种常见窗口设计

  1. 静态固定窗口 传统方式,总 token 上限恒定,输入和输出共享配额。输入越多,留给模型回复的空间越少,绝大多数基础版 LLM 都是这种模式(GPT‑3.5‑8K、Llama‑2‑70B‑4K)。
  2. 分离式上下文(部分新版模型) 把输入上下文和生成输出 token 分开限制:例如输入 128k,输出限制 4k。不管你输入多少历史内容,输出长度独立,不会挤占回复限额,现在旗舰模型普遍采用该方案。

引申出来的现实问题

  1. 长文档一次性喂给模型,如果文档过长超出窗口,模型读取不到全部内容;这时需要用到 RAG 检索增强,拆分文档分段读取,绕开上下文限制。
  2. 长对话聊天,聊天轮次过多,早期对话被丢弃,后期模型会忘记前面提到的要求。
  3. 拓展概念:
  • Extended Context(扩展上下文):通过版本升级把原本 4K 的模型扩容至 32K、128K;
  • Sliding‑window(滑动窗口):模型只保留最近一段对话,更早的历史舍弃,兼顾长对话和推理速度。

简单总结一句话

上下文窗口就是 LLM 的短时记忆容量,你的问题和 AI 的回答都会占用记忆额度,额度耗尽就会丢失旧内容。

更多推荐