目录

基本概念

1Tokens

2最大上下文长度(Context Window)

3embedding

4模型蒸馏

5模型微调

6RAG

7费用和使用限制

1、GPT-5 & 5.1

2、OpenAI Realtime API

3、OpenAI o1

4、GPT4o

5、Claude系列

6、GLM-4


基本概念

1Tokens

在学习大模型时,理解 Tokens 的概念非常重要。

什么是 Tokens?

在大模型体系中,Tokens 可以简单理解为文本的基本构建块。类似于英语中的单词和标点符号,每个 Token 代表输入文本的一个元素。当我们向大模型输入一句话时,这句话会首先被分割成一系列 Tokens,模型根据这些 Tokens 来理解和处理你输入的文本信息。

为什么要引入 Tokens 这个概念?主要原因是 大模型无法直接理解原始文本。将文本分割成 Tokens,可以将复杂的文本信息转换为计算机能够理解和处理的格式。这有助于模型捕捉词汇、语法和上下文之间的关系。

可以简单理解为:Tokens 是连接人类语言和机器语言的桥梁。

Tokens 与文本之间如何转换?

OpenAI 官方提供了一个工具 Tokenizer,可以测试任意输入的文本,并查看它们是如何被转换成 Tokens 的。

Tokenizer 工具地址:https://platform.openai.com/tokenizer

需要注意的是,不同语言转换成 Tokens 时,结果会有所不同。这是因为每种语言的结构、词汇和语法特点各异,导致分词规则和方法不同。一般来说,1 个 Token 约等于 4 个英文字符。

2最大上下文长度(Context Window)

回到模型的基本信息,Context Window 表示每个模型的最大上下文长度。对于 GPT-3.5 和 GPT-4 这类文本生成模型来说,输入的提示语和模型生成的输出内容两部分加起来的总长度不能超过模型的最大上下文长度限制。

例如,对于 gpt-4-0125-preview 模型来说,输入和输出加起来的总和不能超过 128K Tokens(相当于 200 页的 PDF 文档)。

为什么会有最大上下文长度限制?

答案在于 “GPT” 的全称:“Generative Pre-trained Transformer”,即 基于 Transformer 架构的生成式预训练模型。

  • 预训练(Pre-training):模型在大规模数据集上进行训练,学习语言的通用模式和结构。

  • 生成式(Generative):模型有能力生成新的内容,根据之前的文本预测下一个词。

  • Transformer:一种深度学习模型架构,特别适合处理序列数据,如文本。核心是自注意力(Self-Attention)机制,使模型在生成文本时考虑整个文本序列的上下文信息。

由于 GPT 模型在生成每个词时都会考虑之前的所有信息,为了平衡生成文本的质量、连贯性和计算资源的有效使用。所有大模型都有一个输入token的最大长度限制和输出token的最大长度限制。

3embedding

embedding将文本、图像等非结构化数据转换为数值向量(一组数字)的技术。是一种将离散符号(如文字、图片)映射到连续向量空间的数学变换,它基于分布式假设:“上下文相似的词,语义也相似”。

核心作用:

  • 语义理解:将相似含义的内容映射到向量空间中相近的位置

  • 搜索基础:为RAG、相似度搜索提供基础

  • 降维表示:将高维数据压缩为低维向量

工作流程:

原始文本 → 分词 → 查找词向量 → 组合池化 → 文档向量

embedding算法既可以作为一个组件镶嵌在基模内部,也有类似于BGE,gte等独立的Embedding模型,在RAG场景下提供给大模型参考参考

4模型蒸馏

模型蒸馏就是将大型“教师模型”的知识转移给小型“学生模型”的技术。

核心思想:

  • 压缩模型:保持性能的同时大幅减小模型规模

  • 软标签传递:不仅传递正确答案,还传递概率分布

  • 效率提升:让小模型获得接近大模型的能力

完整的蒸馏流程:

阶段1:教师模型推理

输入数据 → 教师模型 → 软标签(概率分布)+ 硬标签

阶段2:损失函数设计

总损失 = α * 蒸馏损失 + β * 学生损失 + γ * 匹配损失

阶段3:渐进式蒸馏

大教师 → 中学生 → 小学生(层层递进)

5模型微调

模型微调就是在预训练大模型基础上,使用特定领域数据继续训练,使其适应具体任务。

主要方式:

  • 全参数微调:更新所有模型参数

  • 参数高效微调(如LoRA、QLoRA):只更新少量参数

  • 适配器微调:插入小型适配器模块

6RAG

RAG是结合信息检索和文本生成的技术框架。

工作流程:

检索:从外部知识库中查找与问题相关的文档

增强:将检索到的文档与原始问题结合

生成:基于增强后的上下文生成回答

核心优势:

  • 知识实时性:无需重新训练即可更新知识

  • 事实准确性:减少大模型“幻觉”

  • 可解释性:提供回答的来源依据

实际应用选择

需要最新知识 → RAG

需要领域专业化 → 微调 + RAG

资源有限/需要快速推理 → 蒸馏

需要语义搜索 → Embedding + 向量数据库

7费用和使用限制

由于 OpenAI 的在线大模型是通过个人 API-Key 验证的方式,向 OpenAI 的线上模型提交计算请求,并实时获取返回结果。在实际调用中,会根据调用的模型类型、调用次数、输入和输出文本的数量进行计费。因此,我们需要时刻关注费用支出情况。

1、GPT-5 & 5.1

OpenAI 于 2025 年 8 月 7 日发布了 GPT-5,这是公司最新一代的大型语言模型(LLM),标志着 AI 技术在推理、多模态处理和任务执行方面的重大进步。GPT-5 的发布是 OpenAI 响应开发者对更强大、更灵活 AI 模型需求的回应,旨在提供一个统一系统,结合快速响应和深度推理能力。

GPT-5 不再是单一模型,而是由多个专用模型组成的统一系统,旨在根据任务需求动态选择最佳模型。

GPT-5 的一个重要创新是引入“测试时计算”,这允许模型在推理阶段动态分配更多计算资源以处理复杂任务。这种方法使 GPT-5 能够在不重新训练模型的情况下,实现更高的准确性和可靠性,尤其是在需要逐步推理或多步操作的任务中。通过结合大型模型和动态计算分配,GPT-5 可以在推理阶段“更努力地思考”,从而显著提高在数学、科学和编程等领域的表现。

此外,GPT-5 的能力减少了幻觉和错误率,使其成为构建复杂 AI 应用程序的理想选择。新功能包括定制化(选择个性、聊天颜色)、语音改进(更好的理解和定制风格)、学习模式(个性化、分步帮助)以及与 Gmail 和 Google Calendar 的连接。

2、OpenAI Realtime API

OpenAI Realtime API 是 OpenAI 推出的一款低延迟、多模态对话式 API,旨在为开发者提供构建接近实时交互体验的能力。Realtime API 通过 WebSocket 协议实现持久连接,支持低延迟的实时通信,并集成了功能调用(Function Calling),使开发者能够触发外部操作或引入动态上下文。

可以应用在比如:语音助手、客户答疑、语言学习、实时翻译、游戏开发等领域。

3、OpenAI o1

OpenAI o1 是一系列大型语言模型,旨在通过链式思维提升复杂问题的解决能力。它的发布标志着 OpenAI 在推理领域的新突破,特别适合需要多步骤逻辑的任务。

o1 被设计为 GPT-4o 的补充而非替代,专注于复杂推理任务。GPT-4o 更适合快速响应和通用任务,而 o1 在数学和科学基准测试中表现更优,例如在 GPQA(物理、生物、化学博士级问题)上超越人类专家水平。然而,o1 的响应时间较长,API 定价较高,开发者需权衡性能与成本。

o1 模型的核心在于其链式思维推理能力,这是一种通过分解问题为中间步骤来模拟人类推理过程的方法。这种方法显著提升了模型在数学、编码和科学任务上的表现。

模型

上下文窗口

最大完成令牌

图像分析

适用场景

成本

o1

128,000

32,768

支持

广泛推理,科学研究

较高

o1-mini

128,000

65,536

不支持

编程、STEM 任务,快速响应

较低(80% 折扣)

o1 pro 模式

128,000

32,768

支持

高精度专业场景

最高

4、GPT4o

GPT-4o 是 OpenAI 于 2024 年 5 月 13 日发布的多模态大型语言模型,支持文本、音频和视觉输入,并能生成文本、音频和图像输出。它旨在提供更自然、直观的交互,特别适合需要多模态处理的应用。

GPT-4o 是多模态 AI 应用的理想选择,其速度、成本和性能优势使其适合客户支持、法律、医疗和教育等场景。开发者应注意上下文管理、知识截止和潜在偏见,确保有效利用模型能力。

5、Claude系列

Claude 系列是由 Anthropic 开发的 AI 模型,旨在提供高性能、安全的对话和任务处理能力。

Claude 3 系列于 2024 年 3 月发布,包括 Haiku、Sonnet 和 Opus 三个模型,分别针对速度、性能和成本进行优化。Claude 3.5 Sonnet 则于 2024 年 6 月发布,是对 Claude 3 系列的重大升级,特别是在推理和编码任务上表现更强。

  • Claude 3系列

    • Claude 3 Haiku:作为系列中最快的模型,适合需要即时响应的任务,如实时客户聊天和数据提取。

    • Claude 3 Sonnet:提供性能和速度的平衡,适合内容创建、编码辅助和复杂数据分析。

    • Claude 3 Opus:性能最高,适合研究、战略规划和高复杂度任务。

6、GLM-4

GLM-4 是一款由中国 AI 初创公司智谱 AI 开发的新一代基座大模型,于 2024 年 1 月发布。其性能被认为与 OpenAI 的 GPT-4 相当,特别适合需要复杂推理和多模态处理的场景。

而和此前ChatGLM3模型所不同的是,GLM-4不再采用开源模式,而是采用了OpenAI和Google大模型的在线大模型模式,即模型无需本地部署,而是通过联网的方式调用智谱算力中心的模型进行推理或微调,用户通过API-KEY进行身份验证,同时根据实际使用模型不同、以及不同的Token数量进行计费。

更多推荐