大语言模型LLM:通过预测下一个 token 学习语言规律的大规模神经网络模型。

自回归生成(Autoregressive Generation)就是按顺序一个一个生成 token:每一步都基于前面已经生成的内容,预测下一个 token。它的核心特点是:后面的内容依赖前面的内容,不能一次性完全并行生成。

Token:模型处理文本时使用的最小离散单位。Token 成本与 Tokenizer 版本强相关。实际 Token 切分由模型供应商的 Tokenizer 实现,不同供应商对相同文本可能产生不同的 Token 序列。

        ·英文:1 Token 大约对应 3~4 个字符(与文本类型相关)。

        ·中文:1 Token 常见在 1~2 个汉字上下波动(与混排比例强相关)。

特殊Token:除了文本内容对应的Token,模型内部还会使用一些特殊标记,这些也会计入Token总数。这些特殊Token通常对用户不可见,但会占用上下文窗口。精确计数时建议使用官方Tokenizer工具而非手动估算。

特殊Token 用途 示例
BOS(Begining of Sequence) 标记序列开始 <s>
EOS(End of Sequence) 标记序列结束 </s>
PAD(Padding) 批处理时填充短序列

<pad>

工具调用标记 Function Calling边界 <tool_call/>

Tokenizer:将文本转换为 token 的编码器。

RAG(Retrieval-Augmented Generation):检索增强生成。是一种先检索外部知识,再结合大模型生成答案的系统架构。其作用是减少幻觉、引入最新知识、让模型访问私有数据、降低重新训练成本等。核心组成为检索器、向量库、Embedding模型、大语言模型LLM。

幻觉(Hallucination):指大语言模型在概率生成过程中产生与真实事实、输入上下文或外部知识不一致内容的现象。

输入上下文:指模型在当前推理或生成过程中可访问的全部输入信息集合,包括提示词、历史对话、系统指令与外部注入内容。

上下文窗口:指模型理论上最多能够容纳的Token上限。它决定了模型在任何时刻可以处理或“记住”的文本量。

        ·对话连续性:决定模型能进行多长的多轮对话而不遗忘早期细节。

        ·单次处理能力:决定模型一次性能够处理的最大文档、代码库或数据样本。

上下文窗口往往被隐形成本占用:

思维链模型的思考过程reasoning_content通常不会被自动包含在下一轮对话的上下文中,只有最终回答content会参与后续对话。

上下文窗口受限于Transformer架构的自注意力机制(Self-Attention):

        ·计算成本平方级增长:计算需求与序列长度呈平方级关系(O(N²))。

        ·推理延迟增加:上下文变长后,模型生成的每个新token时需要关注的历史token变多,TTFT会显著增加。

        ·安全风险增加:更长的上下文意味着更大的攻击面。

工程优化手段:FlashAttention、GQA/MQA、Sliding Window Attention、Ring Attention 等技术已显著降低长上下文的计算和显存开销。但 O(N²) 的理论复杂度仍是上限扩展的根本瓶颈。

上下文溢出常见现象:

        ·模型忽略早期约束

        ·中间丢失现象:即使在1m窗口模型中,模型对开头和结尾的信息最敏感,对中间部分的信息召回率显著下降。

        ·回答漂移:前半段还围绕问题,后半段开始跑题。

        ·RAG失效:检索文档过多,关键信息被稀释;或被截断导致证据链断裂。

        ·成本与延迟激增

检索器(Retriever):用于根据查询从外部知识源中召回相关文档或向量结果的信息检索模块。

向量数据库(Vector Database):用于存储、索引与相似度检索高维向量数据的数据库系统。

Embedding Model(嵌入模型):用于将文本、图像或其他模态数据映射为语义向量表示的神经网络模型。

模态(Modality):指模型处理或表示的信息类型与数据形式,例如文本、图像、音频、视频或传感器信号等。

TTFT(Time to First Token):指用户发起请求后模型生成第一个token所需的时间,用于衡量推理首响应延迟。

OCR(Optical Character Recognition,光学字符识别):指将图像、扫描件或视频中的文字内容转换为可编辑文本的计算机视觉技术。

Logits:模型输出层产生的未经过概率归一化的实值分数向量,用于表示各候选token的相对偏好程度。

Softmax:将logits映射为离散概率分布的归一化函数。

Temperature:作用于logits的缩放参数,用于调节概率分布熵的采样超参数。其中T>1时,分布更加平滑,低概率token更容易被采样到;0<T<1时,分布更尖锐,更倾向于选择高概率token;T≈1时,保持原始分布。温度越低,输出越确定;温度越高,输出越随机。

Top-k:一种固定候选集截断策略,仅保留概率最大的 k 个 token 并重新归一化概率分布。特点:侯选数固定;降低低概率token的干扰;控制生成稳定性。

Top-p:一种基于累计概率质量(Probability Mass)的动态截断采样方法。特点:候选数量动态变化;保留主要概率质量;兼顾稳定性与多样性。

组合 效果 适用场景
T=0(贪婪解码) 永远选最高分,完全确定 结构化输出、可复现场景
低温+Top-p=0.9 相对稳定,但允许措辞上有些变化 分析报告、摘要
中高温+Top-p=0.95 多样性较高,但派出了极端离谱选项 创意写作、对话

Max Tokens:用于限制模型单次生成输出的最大token数量,从而控制响应长度、成本与截断边界。

Stop Sequences:用于指定一个或多个停止字符串,当模型生成到这些序列时立即终止输出,以控制生成内容的结束位置。

Penalty参数:用于通过频率惩罚或存在惩罚调节token的重复概率,从而控制模型输出的多样性、冗余度与主体发散程度。

流式输出:模型每生成一个或几个token,就立刻推送给客户端,用户更早看到内容开始出现。价值:改善用户体验,降低TTFT。

更多推荐