人工智能大模型术语解析手册完整版
涵盖领域:大模型架构、训练技术、推理应用、多模态AI
📋 缩略词索引表(按字母排序)
| 缩略词 | 英文全称 | 中文名称 | 所属类别 |
|---|---|---|---|
| AGI | Artificial General Intelligence | 通用人工智能 | 基础概念 |
| AIGC | Artificial Intelligence Generated Content | 人工智能生成内容 | 内容生产 |
| BERT | Bidirectional Encoder Representations from Transformers | 基于Transformer的双向编码器表示 | 模型架构 |
| BPE | Byte Pair Encoding | 字节对编码 | 分词技术 |
| CLIP | Contrastive Language-Image Pre-training | 对比式语言-图像预训练 | 多模态模型 |
| CoT | Chain of Thought | 思维链 | 提示工程 |
| DALL-E | 无全称(OpenAI产品名) | 文本到图像生成模型 | 多模态模型 |
| FP | Floating Point | 浮点数(如FP16、FP32) | 模型量化 |
| GAI | Generative Artificial Intelligence | 生成式人工智能 | 基础概念 |
| GAN | Generative Adversarial Networks | 生成对抗网络 | 生成模型 |
| GPT | Generative Pre-trained Transformer | 生成式预训练Transformer | 模型架构 |
| GPU | Graphics Processing Unit | 图形处理器 | 硬件基础设施 |
| INT | Integer | 整数(如INT8) | 模型量化 |
| LLM | Large Language Model | 大型语言模型 | 基础概念 |
| LoRA | Low-Rank Adaptation | 低秩适应 | 参数高效微调 |
| LSTM | Long Short-Term Memory | 长短期记忆网络 | 传统架构 |
| MCP | Model Context Protocol | 模型上下文协议 | 系统集成 |
| ML | Machine Learning | 机器学习 | 基础概念 |
| MLP | Multi-Layer Perceptron | 多层感知机 | 神经网络基础 |
| MoE | Mixture of Experts | 混合专家模型 | 模型架构 |
| NLP | Natural Language Processing | 自然语言处理 | 应用领域 |
| NPU | Neural Processing Unit | 神经网络处理器 | 硬件基础设施 |
| PEFT | Parameter-Efficient Fine-Tuning | 参数高效微调 | 训练技术 |
| PGC | Professional Generated Content | 专业生产内容 | 内容生产 |
| PUGC | Professional User Generated Content | 专业用户生产内容 | 内容生产 |
| RAG | Retrieval-Augmented Generation | 检索增强生成 | 增强技术 |
| ReLU | Rectified Linear Unit | 线性整流函数 | 激活函数 |
| RLHF | Reinforcement Learning from Human Feedback | 人类反馈强化学习 | 训练技术 |
| RNN | Recurrent Neural Network | 循环神经网络 | 传统架构 |
| SD | Stable Diffusion | 稳定扩散模型 | 图像生成 |
| SFT | Supervised Fine-Tuning | 有监督微调 | 训练技术 |
| T5 | Text-to-Text Transfer Transformer | 文本到文本迁移Transformer | 模型架构 |
| ToT | Tree of Thoughts | 思想树 | 提示工程 |
| TPU | Tensor Processing Unit | 张量处理器 | 硬件基础设施 |
| UGC | User Generated Content | 用户生产内容 | 内容生产 |
| VLM | Visual Language Model | 视觉语言模型 | 多模态模型 |
| ZeRO | Zero Redundancy Optimizer | 零冗余优化器 | 分布式训练 |
一、基础概念与架构
1.1 人工智能核心类型
生成式人工智能(GAI / Generative AI)
定义:一种能够产生文字、图像、音频、视频或其他媒体内容的人工智能系统。生成模型学习输入数据的模式和结构,然后产生与训练数据相似但具有一定程度新颖性的新内容,而不仅仅是分类或预测数据。
技术框架:
- 生成对抗网络(GAN)
- 基于Transformer的生成式预训练模型(GPT)
- 扩散模型(Diffusion Models)
- 变分自编码器(VAE)
应用案例:ChatGPT对话生成、Midjourney图像创作、Sora视频生成
通用人工智能(AGI / Artificial General Intelligence)
定义:指具备人类一般智能水平的AI系统,能够理解、学习和应用知识解决各种复杂问题,具备跨领域的推理和适应能力。AGI能够像人类一样处理各种未见过的新任务,而不仅限于特定领域。
关键特征:
- 跨领域迁移学习能力
- 抽象推理与逻辑思考
- 自主目标设定与规划
- 常识推理与因果理解
发展现状:目前尚未实现,是AI研究的长期目标和终极挑战
人工智能生成内容(AIGC / AI Generated Content)
定义:利用人工智能技术自动生成的各种内容形式,包括文本、图像、音频、视频、代码、3D模型等。
内容演进历程:
PGC(专业生成) → UGC(用户生成) → PUGC(专业用户生成) → AIGC(AI生成)
核心技术栈:
- 大语言模型(文本生成)
- 扩散模型(图像/视频生成)
- 语音合成模型(音频生成)
- 多模态大模型(跨模态生成)
1.2 大模型基础架构
大型语言模型(LLM / Large Language Model)
定义:基于人工神经网络的语言模型,具有庞大的参数量(通常在数十亿至数万亿级别)以及巨大的训练数据规模。LLM使用自监督学习流程分析海量非结构化数据,基于Transformer模型构建,采用自注意力机制技术理解上下文。
规模演进:
| 模型 | 参数量 | 发布机构 | 年份 |
|---|---|---|---|
| GPT-1 | 1.17亿 | OpenAI | 2018 |
| BERT-Large | 3.4亿 | 2018 | |
| GPT-3 | 1750亿 | OpenAI | 2020 |
| PaLM | 5400亿 | 2022 | |
| GPT-4 | 估计万亿级 | OpenAI | 2023 |
| LLaMA 3 | 4000亿 | Meta | 2024 |
核心能力:
- 自然语言理解与生成
- 上下文学习(In-Context Learning)
- 少样本学习(Few-shot Learning)
- 指令遵循(Instruction Following)
Transformer架构
定义:2017年Google在论文《Attention Is All You Need》中提出的革命性神经网络架构,完全基于注意力机制,摒弃了传统的循环(RNN)和卷积(CNN)结构。
核心创新:
- 自注意力机制(Self-Attention):允许模型在处理序列时关注所有位置
- 多头注意力(Multi-Head Attention):并行计算多组注意力,捕捉不同子空间信息
- 位置编码(Positional Encoding):注入序列位置信息
- 前馈神经网络(FFN):对每个位置独立进行非线性变换
架构变体:
- 编码器-only(如BERT):双向编码,适合理解任务
- 解码器-only(如GPT):自回归生成,适合生成任务
- 编码器-解码器(如T5):序列到序列转换,适合翻译/摘要
自注意力机制(Self-Attention Mechanism)
定义:Transformer架构的核心组件,允许输入序列中的每个元素都能注意到该序列中的所有其他元素,动态分配权重聚焦关键信息。
计算公式:
Attention(Q, K, V) = softmax(QK^T / √d_k) V
其中:
- Q(Query):查询向量,表示当前关注的内容
- K(Key):键向量,表示被关注内容的关键信息
- V(Value):值向量,实际传递的信息内容
- d_k:键向量的维度,用于缩放防止梯度消失
优势:
- 并行计算(相比RNN的串行计算)
- 长距离依赖建模(任意两个token直接交互)
- 可解释性(注意力权重显示模型关注点)
二、主流模型家族详解
2.1 编码器架构(理解任务)
BERT(Bidirectional Encoder Representations from Transformers)
定义:Google于2018年提出的双向编码器表示模型,采用Transformer的编码器结构,通过双向训练(同时考虑左右上下文)捕捉词语的上下文依赖关系。
技术特点:
- 双向训练:同时从左到右和从右到左读取文本
- 预训练任务:
- MLM(Masked Language Model):随机遮蔽15%的token进行预测
- NSP(Next Sentence Prediction):预测两个句子是否连续
- 参数量:Base版1.1亿,Large版3.4亿
适用任务:
- 文本分类(情感分析、主题分类)
- 命名实体识别(NER)
- 问答系统(抽取式QA)
- 语义相似度计算
2.2 解码器架构(生成任务)
GPT系列(Generative Pre-trained Transformer)
定义:OpenAI开发的生成式预训练Transformer模型系列,采用自回归(Auto-regressive)方式逐token生成文本。
演进历程:
| 版本 | 参数量 | 上下文长度 | 关键特性 |
|---|---|---|---|
| GPT-1 | 1.17亿 | 512 tokens | 无监督预训练 + 有监督微调 |
| GPT-2 | 15亿 | 1024 tokens | 零样本任务迁移能力 |
| GPT-3 | 1750亿 | 2048 tokens | 上下文学习(In-Context Learning) |
| GPT-3.5 | 未公开 | 4096 tokens | 指令微调(Instruction Tuning) |
| GPT-4 | 估计万亿级 | 128K tokens | 多模态(文本+图像)、推理能力飞跃 |
| GPT-4o | 未公开 | 128K tokens | 原生多模态、实时交互 |
训练范式:
- 预训练:海量互联网文本,自回归预测下一个token
- 监督微调(SFT):指令数据集微调
- RLHF:人类反馈强化学习对齐人类偏好
LLaMA(Large Language Model Meta AI)
定义:Meta开源的大语言模型系列,明确优化用于研究和轻量级部署,提供多种参数规模版本。
版本对比:
| 版本 | 参数规模 | 训练数据量 | 上下文长度 | 特色 |
|---|---|---|---|---|
| LLaMA 1 | 7B/13B/33B/65B | 1.4T tokens | 2K | 开源可商用 |
| LLaMA 2 | 7B/13B/70B | 2T tokens | 4K | 分组查询注意力(GQA) |
| LLaMA 3 | 8B/70B/400B | 15T tokens | 8K | 多语言、工具使用 |
架构优化:
- RMSNorm:替代LayerNorm,提升训练稳定性
- SwiGLU激活函数:替代ReLU,增强表达能力
- 旋转位置编码(RoPE):替代绝对位置编码,更好处理长序列
- 分组查询注意力(GQA):推理时减少KV缓存内存
2.3 编码器-解码器架构
T5(Text-to-Text Transfer Transformer)
定义:Google提出的统一框架模型,将所有NLP任务都转换为文本到文本的格式,使用统一的编码器-解码器架构处理。
统一格式示例:
翻译:translate English to German: "The house is wonderful" → "Das Haus ist wunderbar"
摘要:summarize: <文章内容> → <摘要内容>
分类:cola sentence: <句子> → acceptable/unacceptable
规模变体:
- T5-Small(6000万参数)
- T5-Base(2.2亿参数)
- T5-Large(7.7亿参数)
- T5-3B(30亿参数)
- T5-11B(110亿参数)
2.4 多模态模型
CLIP(Contrastive Language-Image Pre-training)
定义:OpenAI开发的多模态模型,联合训练文本编码器和图像编码器,通过对比学习建立跨模态语义关联。
训练方式:
- 从互联网收集4亿对(图像,文本)数据
- 对比学习:拉近匹配对的嵌入距离,推远非匹配对
- 零样本分类:通过文本提示实现图像分类无需标注数据
应用:
- 零样本图像分类
- 图像-文本检索
- 文本引导的图像生成(作为DALL-E的组件)
- 语义搜索
视觉语言模型(VLM / Visual Language Model)
定义:能够同时处理图像和文本数据,实现跨模态理解和生成的模型。
典型架构:
- 视觉编码器:ViT(Vision Transformer)或CNN提取图像特征
- 投影层:将视觉特征对齐到语言模型空间
- 大语言模型:处理融合后的多模态表示
代表模型:
- GPT-4V(OpenAI)
- Gemini(Google)
- LLaVA(开源)
- Qwen-VL(阿里巴巴)
三、训练与优化技术
3.1 训练阶段
预训练(Pre-training)
定义:在大规模无标签数据上训练模型,学习通用语言表示、世界知识和推理能力。
数据规模:
- 现代LLM通常训练于数万亿token的文本数据
- 数据来源:网页、书籍、代码、学术论文等
训练目标:
- 语言建模(LM):预测下一个token(GPT系列)
- 遮蔽语言建模(MLM):预测被遮蔽的token(BERT系列)
- 去噪:重构被噪声破坏的输入(BART/T5)
计算资源:
- GPT-3训练消耗约355年的GPU时间
- LLaMA 2 70B使用2000个A100 GPU训练
微调(Fine-tuning)
定义:在特定任务的小规模标注数据上调整预训练模型参数,使模型适应特定应用场景。
适用场景:
- 目标任务与预训练任务相似但数据量较少
- 需要模型适应特定领域(医疗、法律、金融)
- 需要模型遵循特定输出格式
传统微调 vs 现代微调:
| 维度 | 传统微调 | 现代指令微调 |
|---|---|---|
| 数据格式 | 单任务标注 | 多任务指令-输出对 |
| 目标 | 任务性能 | 指令遵循 + 泛化 |
| 典型方法 | 全参数更新 | LoRA等PEFT方法 |
有监督微调(SFT / Supervised Fine-Tuning)
定义:使用人工标注的(指令,输出)数据对对预训练模型进行微调,是RLHF流程中的重要步骤。
数据构成:
- 用户指令(Instruction)
- 上下文(Context,可选)
- 期望输出(Output)
- 辅助信息(如思维链推理过程)
示例数据格式:
{
"instruction": "解释量子计算的基本原理",
"input": "",
"output": "量子计算利用量子力学原理进行计算。其核心概念包括:\n1. 量子比特(Qubit):不同于经典比特的0或1,量子比特可以处于叠加态..."
}
人类反馈强化学习(RLHF / Reinforcement Learning from Human Feedback)
定义:结合人类偏好反馈与强化学习(PPO算法)的训练方法,使模型输出符合人类价值观和偏好。
三阶段流程:
┌─────────────────┐ ┌─────────────────┐ ┌─────────────────┐
│ 阶段1:SFT │ → │ 阶段2:奖励模型 │ → │ 阶段3:RL训练 │
│ 监督微调训练 │ │ 学习人类偏好 │ │ PPO优化策略 │
└─────────────────┘ └─────────────────┘ └─────────────────┘
- SFT阶段:使用高质量指令数据微调基础模型
- 奖励模型训练:对同一提示的多个输出进行人工排序,训练奖励模型预测人类偏好
- PPO强化学习:使用奖励模型作为奖励函数,通过PPO算法优化策略模型
替代方案:
- DPO(Direct Preference Optimization):直接用偏好数据优化,无需显式奖励模型
- RLAIF:使用AI反馈替代人类反馈,降低成本
3.2 参数高效微调(PEFT / Parameter-Efficient Fine-Tuning)
定义:在保持大部分预训练参数不变的情况下,通过引入少量可训练参数来适配下游任务的技术。
优势:
- 显存需求降低90%以上
- 训练速度提升数倍
- 可训练参数可独立保存(每个任务仅几十MB)
- 避免灾难性遗忘
低秩适应(LoRA / Low-Rank Adaptation)
定义:通过低秩矩阵分解注入可训练参数,在不修改基础大模型参数的前提下实现高效适配。
数学原理: 对于预训练权重矩阵 $W_0 \in \mathbb{R}^{d imes k}$,LoRA引入低秩分解:
W = W_0 + ΔW = W_0 + BA
其中 $B \in \mathbb{R}^{d imes r}$,$A \in \mathbb{R}^{r imes k}$,$r \ll \min(d,k)$(秩通常为8-64)
配置参数:
- r(秩):控制低秩矩阵的维度,越大表达能力越强
- lora_alpha:缩放参数,实际缩放为
lora_alpha / r - target_modules:应用LoRA的模块(通常为q_proj, v_proj等注意力层)
训练资源对比:
| 方法 | 可训练参数 | 显存需求 | 存储需求 |
|---|---|---|---|
| 全量微调 | 100% | 高(需多卡) | 大(GB级) |
| LoRA | 0.1%-1% | 低(单卡可行) | 小(MB级) |
QLoRA(Quantized LoRA)
定义:结合4-bit量化和LoRA的技术,进一步降低显存需求,使得在消费级GPU上微调大模型成为可能。
关键技术:
- 4-bit NormalFloat量化:信息论最优的4-bit数据类型
- 双量化:对量化常数进行二次量化
- 分页优化器:使用NVIDIA统一内存避免梯度检查点内存峰值
效果:可在单张24GB显存GPU上微调65B参数模型
3.3 模型压缩与推理优化
量化(Quantization)
定义:将模型参数从高精度(如FP32)转换为低精度(如INT8、INT4),显著降低存储需求和计算复杂度。
量化精度对比:
| 精度 | 位数 | 相对存储 | 典型应用 |
|---|---|---|---|
| FP32 | 32位 | 100% | 训练默认精度 |
| FP16/BF16 | 16位 | 50% | 混合精度训练 |
| INT8 | 8位 | 25% | 推理加速 |
| INT4/FP4 | 4位 | 12.5% | 极致压缩 |
| NF4 | 4位 | 12.5% | QLoRA训练 |
量化方法:
- PTQ(训练后量化):直接量化预训练模型,无需重新训练
- QAT(量化感知训练):在训练中模拟低精度,精度损失更小
- GPTQ/AWQ:针对LLM的专用量化方法,保持生成质量
知识蒸馏(Knowledge Distillation)
定义:将大模型(教师模型)的知识迁移到小模型(学生模型),通过让小模型学习大模型的输出分布,兼顾性能与效率。
蒸馏类型:
- 白盒蒸馏:可访问教师模型内部表示(隐藏层、注意力矩阵)
- 黑盒蒸馏:仅可访问教师模型输出(API调用)
- 自蒸馏:同一模型的不同视图或不同时间步
损失函数:
L = α * L_hard(硬标签交叉熵) + (1-α) * L_soft(软标签KL散度)
温度参数T:控制软标签的平滑程度,T越高分布越平缓,传递更多暗知识
剪枝(Pruning)
定义:去除神经网络中冗余的权重或神经元,简化模型结构。
剪枝类型:
- 非结构化剪枝:逐个移除权重,需要硬件支持稀疏计算
- 结构化剪枝:移除整个通道、层或注意力头,保持密集计算效率
- 半结构化剪枝:如N:M稀疏模式(每M个权重保留N个),GPU友好
剪枝策略:
- 幅度剪枝:移除绝对值最小的权重
- 重要性剪枝:基于梯度或Hessian矩阵评估重要性
- 彩票假说(Lottery Ticket Hypothesis):随机初始化中存在稀疏子网络可达到原网络性能
四、推理与应用技术
4.1 提示工程(Prompt Engineering)
定义:设计和优化输入提示以引导大语言模型生成期望输出的技术。提示的质量直接影响模型表现。
提示核心要素:
- 指令(Instruction):明确告诉模型要做什么
- 上下文(Context):提供背景信息
- 输入数据(Input Data):具体处理对象
- 输出指示器(Output Indicator):指定输出格式
- 角色扮演(Role):设定模型身份(专家、助手等)
零样本提示(Zero-shot Prompting)
定义:只向模型提供任务描述或问题,不提供任何示例的提示方法,完全依赖模型的泛化能力。
适用场景:
- 简单明确的任务
- 模型已具备相关能力
- 快速原型验证
示例:
将以下英文翻译成中文:
"The future of AI is promising."
少样本提示(Few-shot Prompting)
定义:在提示中提供少量示例(通常为1-10个),引导模型理解任务模式并生成符合期望的输出。
示例(情感分析):
判断以下评论的情感倾向(正面/负面):
评论:"这部电影太棒了,强烈推荐!"
情感:正面
评论:"完全浪费时间,剧情混乱。"
情感:负面
评论:"演员表演出色,但剧本有待改进。"
情感:
最佳实践:
- 示例应具有代表性
- 输入-输出格式保持一致
- 示例顺序可能影响模型偏见(近期示例权重更高)
思维链(CoT / Chain of Thought)
定义:通过引导模型生成中间推理步骤(如"让我们一步步思考...")来提升复杂问题解决能力的提示技术。
标准CoT vs 自一致性CoT:
| 类型 | 方法 | 效果 |
|---|---|---|
| Zero-shot CoT | 添加"Let's think step by step" | 基础推理能力激活 |
| Few-shot CoT | 提供含推理过程的示例 | 更准确的推理模式 |
| Self-Consistency | 多次采样,选择最一致答案 | 提升复杂问题准确性 |
示例(数学问题):
问题:一个农场有鸡和兔共35只,脚共94只。鸡兔各几只?
让我们一步步思考:
1. 设鸡有x只,兔有y只
2. 根据题意:x + y = 35(总头数)
3. 2x + 4y = 94(总脚数,鸡2脚,兔4脚)
4. 从方程1得:x = 35 - y
5. 代入方程2:2(35-y) + 4y = 94
6. 70 - 2y + 4y = 94 → 2y = 24 → y = 12
7. 所以兔12只,鸡23只
思想树(ToT / Tree of Thoughts)
定义:思维链的泛化形式,允许模型同时探索多个不同的推理路径,通过评估和回溯找到最优解决方案。
工作流程:
- 分解:将问题分解为多个思考步骤
- 生成:每个步骤生成多个候选思路
- 评估:使用LLM或启发式函数评估各思路
- 搜索:使用BFS或DFS搜索最佳路径
- 回溯:当路径不佳时回退尝试其他选择
适用场景:
- 需要探索的开放式问题
- 创意写作
- 数学证明
- 游戏策略
4.2 增强与扩展技术
检索增强生成(RAG / Retrieval-Augmented Generation)
定义:使大语言模型能够从外部数据源检索并集成新信息的技术,将检索系统与生成模型结合。
架构流程:
用户查询 → 向量化 → 向量检索 → 获取相关文档 → 构建增强提示 → LLM生成回答
RAG vs 微调对比:
| 维度 | RAG | 微调 |
|---|---|---|
| 知识更新 | 实时更新(换文档即可) | 需重新训练 |
| hallucination | 显著降低(有事实依据) | 依赖训练数据质量 |
| 透明度 | 可追溯来源 | 黑盒 |
| 成本 | 低(无需训练) | 高(需计算资源) |
| 适用场景 | 知识密集型任务 | 风格/行为定制 |
高级RAG技术:
- 重排序(Re-ranking):使用更精确模型对检索结果二次排序
- 查询重写(Query Rewriting):优化查询以提高检索质量
- 混合检索:结合向量检索和关键词检索
- 图RAG:利用知识图谱增强上下文
模型上下文协议(MCP / Model Context Protocol)
定义:Anthropic于2024年提出的开放协议,标准化AI模型与外部数据源、工具之间的连接方式。
核心理念:
- 类似"AI模型的USB-C接口"
- 统一接口连接各种数据源和工具
- 解决LLM与外部系统集成的碎片化问题
架构组件:
- MCP服务器:封装数据源或工具,提供标准接口
- MCP客户端:LLM应用中的协议实现
- 传输层:支持stdio(本地)或HTTP SSE(远程)
支持的数据源类型:
- 本地文件系统
- 数据库(PostgreSQL、SQLite等)
- 企业系统(Slack、GitHub、Google Drive等)
- 自定义API
代理(Agent / AI Agent)
定义:具有自主决策能力、能够执行复杂任务的AI系统,能够规划、推理、使用工具、与环境交互并根据反馈调整行为。
典型架构(ReAct模式):
Thought(思考)→ Action(行动)→ Observation(观察)→ ... → Answer(回答)
核心模块:
- 规划(Planning):分解任务,制定执行计划
- 记忆(Memory):
- 短期记忆:对话历史、上下文
- 长期记忆:知识库、经验存储
- 工具使用(Tool Use):调用外部API、代码执行、数据库查询
- 反思(Reflection):评估执行结果,自我修正
代理类型:
- 单代理:单一LLM自主完成任务
- 多代理(Multi-Agent):多个代理协作,各负责不同子任务
- 层级代理:高层代理规划,低层代理执行
五、关键现象与挑战
5.1 涌现能力(Emergent Abilities)
定义:当模型规模达到特定阈值时突然出现的意外能力,这些能力在小模型中不存在,在大模型中突然出现。
典型涌现能力:
- 上下文学习:无需梯度更新,仅通过提示中的示例学习新任务
- 指令遵循:理解并执行自然语言指令
- 思维链推理:生成中间推理步骤解决复杂问题
- 多步算术:执行多步骤数学计算
规模阈值现象: 研究表明,某些能力仅在模型参数量超过特定阈值(如100B)时才出现,呈现相变(Phase Transition)特征。
5.2 幻觉(Hallucination)
定义:大模型生成看似合理但实际上不准确或虚构的信息的现象,是文本生成任务中的常见问题。
幻觉类型:
- 事实性幻觉:生成与事实不符的内容(如错误的历史日期)
- 忠实性幻觉:生成与输入或上下文不一致的内容(如摘要偏离原文)
缓解策略:
- RAG:提供外部知识源
- 事实核查:后处理验证生成内容
- 训练数据清洗:减少训练数据中的错误信息
- RLHF:训练模型表达不确定性
- 检索增强生成:强制基于检索内容回答
5.3 灾难性遗忘(Catastrophic Forgetting)
定义:模型在微调新任务时遗忘旧任务知识的问题,是多任务学习和持续学习中的核心挑战。
发生机制:
- 神经网络参数在微调时被完全覆盖
- 新任务梯度更新破坏旧任务的参数配置
解决方案:
- 弹性权重巩固(EWC):限制重要参数的变化
- 记忆回放(Replay):混合旧任务样本进行训练
- 模块化架构:不同任务使用不同子网络
- 参数高效微调(LoRA等):冻结主干,仅更新少量参数
5.4 上下文学习(In-Context Learning)
定义:大模型无需参数更新,仅通过提示中提供的示例或上下文就能适应新任务的能力。
关键发现:
- 示例数量、顺序、格式都影响学习效果
- 示例标签正确性不如示例格式重要(随机标签也能部分有效)
- 模型规模越大,上下文学习能力越强
与梯度学习的区别:
| 特性 | 上下文学习 | 梯度学习(微调) |
|---|---|---|
| 参数更新 | 无 | 有 |
| 计算成本 | 低(推理时) | 高(训练时) |
| 持久性 | 单次对话有效 | 永久改变模型 |
| 数据需求 | 几个示例 | 大量数据 |
六、硬件与基础设施
6.1 AI加速器
GPU(Graphics Processing Unit)
定义:图形处理器,深度学习训练的主要计算设备,擅长并行计算。
主流AI GPU:
- NVIDIA A100/H100:数据中心级,支持大规模分布式训练
- NVIDIA RTX 4090:消费级,适合小规模微调
- AMD MI300X:NVIDIA竞品,大显存优势
关键指标:
- 显存容量(决定可训练模型规模)
- 张量核心(Tensor Core)性能
- NVLink互联带宽(多卡通信)
TPU(Tensor Processing Unit)
定义:Google开发的专用AI加速器,针对张量运算优化,用于大规模模型训练。
版本演进:
- TPU v1:仅推理
- TPU v2/v3:支持训练,v3性能是v2的2倍
- TPU v4/v5:更高性能,支持更大规模集群
架构特点:
- 脉动阵列(Systolic Array):优化矩阵乘法
- 高带宽内存(HBM):提供充足内存带宽
- Torus网络拓扑:高效的多芯片互联
NPU(Neural Processing Unit)
定义:神经网络处理器,专为AI推理设计的低功耗芯片,常见于移动设备。
应用场景:
- 手机端侧AI(拍照优化、语音助手)
- 智能摄像头
- 自动驾驶边缘计算
代表产品:
- Apple Neural Engine
- 华为昇腾(Ascend)
- 高通Hexagon
6.2 分布式训练
数据并行(Data Parallelism)
定义:将数据批次分割到多个设备,每个设备持有完整模型副本,梯度聚合后同步更新。
实现方式:
- DDP(DistributedDataParallel):PyTorch标准方案
- Horovod:Uber开源,支持多种框架
模型并行(Model Parallelism)
定义:将模型参数分割到多个设备,每个设备处理部分层或部分参数。
适用场景:
- 模型太大无法放入单卡显存
- 流水线并行和张量并行
ZeRO(Zero Redundancy Optimizer)
定义:DeepSpeed提出的优化器状态、梯度和参数分区技术,实现万亿参数模型训练。
三个阶段:
- ZeRO-1:仅分区优化器状态
- ZeRO-2:分区优化器状态+梯度
- ZeRO-3:分区优化器状态+梯度+参数
效果:单卡可训练模型规模提升数倍
6.3 向量数据库
定义:专门用于存储和检索高维向量(嵌入)的数据库,是RAG系统的关键组件。
核心能力:
- 相似度搜索:基于余弦相似度或欧氏距离
- 近似最近邻(ANN):平衡搜索速度和精度
- 混合查询:结合向量相似度和元数据过滤
主流产品:
- 开源:Milvus、Weaviate、Qdrant、Chroma
- 云服务:Pinecone、Azure Cognitive Search
七、内容生产模式演进
7.1 四代内容生产模式对比
| 模式 | 英文全称 | 核心特征 | 代表平台/工具 | 质量 | 成本 |
|---|---|---|---|---|---|
| PGC | Professional Generated Content | 专业团队、精品化、高成本 | 电视台、报社、好莱坞 | 高 | 高 |
| UGC | User Generated Content | 用户自发、海量、多元 | YouTube、抖音、微博 | 参差不齐 | 低 |
| PUGC | Professional User Generated Content | 专业背景用户、垂直深度 | B站UP主、知乎大V | 中高 | 中 |
| AIGC | AI Generated Content | AI自动生成、高效率、个性化 | ChatGPT、Midjourney、Sora | 可调 | 极低 |
7.2 AIGC技术栈映射
文本生成:GPT-4、Claude、LLaMA → 文章、代码、诗歌、报告
图像生成:DALL-E 3、Midjourney、Stable Diffusion → 插画、设计、摄影
音频生成:Suno、ElevenLabs → 音乐、配音、有声书
视频生成:Sora、Runway Gen-2 → 短片、动画、特效
3D生成:DreamFusion、Point-E → 模型、场景、游戏资产
八、附录:术语速查表
8.1 按应用场景分类
模型架构类: Transformer、BERT、GPT、T5、LLaMA、PaLM、MoE、RNN、LSTM、MLP
训练技术类: Pre-training、Fine-tuning、SFT、RLHF、LoRA、QLoRA、PEFT、Quantization、Distillation、Pruning
推理应用类: Prompt Engineering、CoT、ToT、RAG、Agent、MCP、Zero-shot、Few-shot
多模态类: CLIP、VLM、DALL-E、Stable Diffusion、AIGC、GAN
基础设施类: GPU、TPU、NPU、ZeRO、Vector DB、FP16/INT8
8.2 关键论文与资源
| 术语 | 里程碑论文/资源 | 年份 |
|---|---|---|
| Transformer | "Attention Is All You Need" | 2017 |
| BERT | "BERT: Pre-training of Deep Bidirectional Transformers" | 2018 |
| GPT-3 | "Language Models are Few-Shot Learners" | 2020 |
| RLHF | "Training language models to follow instructions with human feedback" | 2022 |
| LoRA | "LoRA: Low-Rank Adaptation of Large Language Models" | 2021 |
| RAG | "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks" | 2020 |
| CLIP | "Learning Transferable Visual Models From Natural Language Supervision" | 2021 |
更多推荐


所有评论(0)