涵盖领域:大模型架构、训练技术、推理应用、多模态AI


📋 缩略词索引表(按字母排序)

缩略词英文全称中文名称所属类别
AGIArtificial General Intelligence通用人工智能基础概念
AIGCArtificial Intelligence Generated Content人工智能生成内容内容生产
BERTBidirectional Encoder Representations from Transformers基于Transformer的双向编码器表示模型架构
BPEByte Pair Encoding字节对编码分词技术
CLIPContrastive Language-Image Pre-training对比式语言-图像预训练多模态模型
CoTChain of Thought思维链提示工程
DALL-E无全称(OpenAI产品名)文本到图像生成模型多模态模型
FPFloating Point浮点数(如FP16、FP32)模型量化
GAIGenerative Artificial Intelligence生成式人工智能基础概念
GANGenerative Adversarial Networks生成对抗网络生成模型
GPTGenerative Pre-trained Transformer生成式预训练Transformer模型架构
GPUGraphics Processing Unit图形处理器硬件基础设施
INTInteger整数(如INT8)模型量化
LLMLarge Language Model大型语言模型基础概念
LoRALow-Rank Adaptation低秩适应参数高效微调
LSTMLong Short-Term Memory长短期记忆网络传统架构
MCPModel Context Protocol模型上下文协议系统集成
MLMachine Learning机器学习基础概念
MLPMulti-Layer Perceptron多层感知机神经网络基础
MoEMixture of Experts混合专家模型模型架构
NLPNatural Language Processing自然语言处理应用领域
NPUNeural Processing Unit神经网络处理器硬件基础设施
PEFTParameter-Efficient Fine-Tuning参数高效微调训练技术
PGCProfessional Generated Content专业生产内容内容生产
PUGCProfessional User Generated Content专业用户生产内容内容生产
RAGRetrieval-Augmented Generation检索增强生成增强技术
ReLURectified Linear Unit线性整流函数激活函数
RLHFReinforcement Learning from Human Feedback人类反馈强化学习训练技术
RNNRecurrent Neural Network循环神经网络传统架构
SDStable Diffusion稳定扩散模型图像生成
SFTSupervised Fine-Tuning有监督微调训练技术
T5Text-to-Text Transfer Transformer文本到文本迁移Transformer模型架构
ToTTree of Thoughts思想树提示工程
TPUTensor Processing Unit张量处理器硬件基础设施
UGCUser Generated Content用户生产内容内容生产
VLMVisual Language Model视觉语言模型多模态模型
ZeROZero Redundancy Optimizer零冗余优化器分布式训练

一、基础概念与架构

1.1 人工智能核心类型

生成式人工智能(GAI / Generative AI)

定义:一种能够产生文字、图像、音频、视频或其他媒体内容的人工智能系统。生成模型学习输入数据的模式和结构,然后产生与训练数据相似但具有一定程度新颖性的新内容,而不仅仅是分类或预测数据。

技术框架

  • 生成对抗网络(GAN)
  • 基于Transformer的生成式预训练模型(GPT)
  • 扩散模型(Diffusion Models)
  • 变分自编码器(VAE)

应用案例:ChatGPT对话生成、Midjourney图像创作、Sora视频生成


通用人工智能(AGI / Artificial General Intelligence)

定义:指具备人类一般智能水平的AI系统,能够理解、学习和应用知识解决各种复杂问题,具备跨领域的推理和适应能力。AGI能够像人类一样处理各种未见过的新任务,而不仅限于特定领域。

关键特征

  • 跨领域迁移学习能力
  • 抽象推理与逻辑思考
  • 自主目标设定与规划
  • 常识推理与因果理解

发展现状:目前尚未实现,是AI研究的长期目标和终极挑战


人工智能生成内容(AIGC / AI Generated Content)

定义:利用人工智能技术自动生成的各种内容形式,包括文本、图像、音频、视频、代码、3D模型等。

内容演进历程

PGC(专业生成) → UGC(用户生成) → PUGC(专业用户生成) → AIGC(AI生成)

核心技术栈

  • 大语言模型(文本生成)
  • 扩散模型(图像/视频生成)
  • 语音合成模型(音频生成)
  • 多模态大模型(跨模态生成)

1.2 大模型基础架构

大型语言模型(LLM / Large Language Model)

定义:基于人工神经网络的语言模型,具有庞大的参数量(通常在数十亿至数万亿级别)以及巨大的训练数据规模。LLM使用自监督学习流程分析海量非结构化数据,基于Transformer模型构建,采用自注意力机制技术理解上下文。

规模演进

模型参数量发布机构年份
GPT-11.17亿OpenAI2018
BERT-Large3.4亿Google2018
GPT-31750亿OpenAI2020
PaLM5400亿Google2022
GPT-4估计万亿级OpenAI2023
LLaMA 34000亿Meta2024

核心能力

  • 自然语言理解与生成
  • 上下文学习(In-Context Learning)
  • 少样本学习(Few-shot Learning)
  • 指令遵循(Instruction Following)

Transformer架构

定义:2017年Google在论文《Attention Is All You Need》中提出的革命性神经网络架构,完全基于注意力机制,摒弃了传统的循环(RNN)和卷积(CNN)结构。

核心创新

  1. 自注意力机制(Self-Attention):允许模型在处理序列时关注所有位置
  2. 多头注意力(Multi-Head Attention):并行计算多组注意力,捕捉不同子空间信息
  3. 位置编码(Positional Encoding):注入序列位置信息
  4. 前馈神经网络(FFN):对每个位置独立进行非线性变换

架构变体

  • 编码器-only(如BERT):双向编码,适合理解任务
  • 解码器-only(如GPT):自回归生成,适合生成任务
  • 编码器-解码器(如T5):序列到序列转换,适合翻译/摘要

自注意力机制(Self-Attention Mechanism)

定义:Transformer架构的核心组件,允许输入序列中的每个元素都能注意到该序列中的所有其他元素,动态分配权重聚焦关键信息。

计算公式

Attention(Q, K, V) = softmax(QK^T / √d_k) V

其中:

  • Q(Query):查询向量,表示当前关注的内容
  • K(Key):键向量,表示被关注内容的关键信息
  • V(Value):值向量,实际传递的信息内容
  • d_k:键向量的维度,用于缩放防止梯度消失

优势

  • 并行计算(相比RNN的串行计算)
  • 长距离依赖建模(任意两个token直接交互)
  • 可解释性(注意力权重显示模型关注点)

二、主流模型家族详解

2.1 编码器架构(理解任务)

BERT(Bidirectional Encoder Representations from Transformers)

定义:Google于2018年提出的双向编码器表示模型,采用Transformer的编码器结构,通过双向训练(同时考虑左右上下文)捕捉词语的上下文依赖关系。

技术特点

  • 双向训练:同时从左到右和从右到左读取文本
  • 预训练任务
    • MLM(Masked Language Model):随机遮蔽15%的token进行预测
    • NSP(Next Sentence Prediction):预测两个句子是否连续
  • 参数量:Base版1.1亿,Large版3.4亿

适用任务

  • 文本分类(情感分析、主题分类)
  • 命名实体识别(NER)
  • 问答系统(抽取式QA)
  • 语义相似度计算

2.2 解码器架构(生成任务)

GPT系列(Generative Pre-trained Transformer)

定义:OpenAI开发的生成式预训练Transformer模型系列,采用自回归(Auto-regressive)方式逐token生成文本。

演进历程

版本参数量上下文长度关键特性
GPT-11.17亿512 tokens无监督预训练 + 有监督微调
GPT-215亿1024 tokens零样本任务迁移能力
GPT-31750亿2048 tokens上下文学习(In-Context Learning)
GPT-3.5未公开4096 tokens指令微调(Instruction Tuning)
GPT-4估计万亿级128K tokens多模态(文本+图像)、推理能力飞跃
GPT-4o未公开128K tokens原生多模态、实时交互

训练范式

  1. 预训练:海量互联网文本,自回归预测下一个token
  2. 监督微调(SFT):指令数据集微调
  3. RLHF:人类反馈强化学习对齐人类偏好

LLaMA(Large Language Model Meta AI)

定义:Meta开源的大语言模型系列,明确优化用于研究和轻量级部署,提供多种参数规模版本。

版本对比

版本参数规模训练数据量上下文长度特色
LLaMA 17B/13B/33B/65B1.4T tokens2K开源可商用
LLaMA 27B/13B/70B2T tokens4K分组查询注意力(GQA)
LLaMA 38B/70B/400B15T tokens8K多语言、工具使用

架构优化

  • RMSNorm:替代LayerNorm,提升训练稳定性
  • SwiGLU激活函数:替代ReLU,增强表达能力
  • 旋转位置编码(RoPE):替代绝对位置编码,更好处理长序列
  • 分组查询注意力(GQA):推理时减少KV缓存内存

2.3 编码器-解码器架构

T5(Text-to-Text Transfer Transformer)

定义:Google提出的统一框架模型,将所有NLP任务都转换为文本到文本的格式,使用统一的编码器-解码器架构处理。

统一格式示例

翻译:translate English to German: "The house is wonderful" → "Das Haus ist wunderbar"
摘要:summarize: <文章内容> → <摘要内容>
分类:cola sentence: <句子> → acceptable/unacceptable

规模变体

  • T5-Small(6000万参数)
  • T5-Base(2.2亿参数)
  • T5-Large(7.7亿参数)
  • T5-3B(30亿参数)
  • T5-11B(110亿参数)

2.4 多模态模型

CLIP(Contrastive Language-Image Pre-training)

定义:OpenAI开发的多模态模型,联合训练文本编码器和图像编码器,通过对比学习建立跨模态语义关联。

训练方式

  • 从互联网收集4亿对(图像,文本)数据
  • 对比学习:拉近匹配对的嵌入距离,推远非匹配对
  • 零样本分类:通过文本提示实现图像分类无需标注数据

应用

  • 零样本图像分类
  • 图像-文本检索
  • 文本引导的图像生成(作为DALL-E的组件)
  • 语义搜索

视觉语言模型(VLM / Visual Language Model)

定义:能够同时处理图像和文本数据,实现跨模态理解和生成的模型。

典型架构

  1. 视觉编码器:ViT(Vision Transformer)或CNN提取图像特征
  2. 投影层:将视觉特征对齐到语言模型空间
  3. 大语言模型:处理融合后的多模态表示

代表模型

  • GPT-4V(OpenAI)
  • Gemini(Google)
  • LLaVA(开源)
  • Qwen-VL(阿里巴巴)

三、训练与优化技术

3.1 训练阶段

预训练(Pre-training)

定义:在大规模无标签数据上训练模型,学习通用语言表示、世界知识和推理能力。

数据规模

  • 现代LLM通常训练于数万亿token的文本数据
  • 数据来源:网页、书籍、代码、学术论文等

训练目标

  • 语言建模(LM):预测下一个token(GPT系列)
  • 遮蔽语言建模(MLM):预测被遮蔽的token(BERT系列)
  • 去噪:重构被噪声破坏的输入(BART/T5)

计算资源

  • GPT-3训练消耗约355年的GPU时间
  • LLaMA 2 70B使用2000个A100 GPU训练

微调(Fine-tuning)

定义:在特定任务的小规模标注数据上调整预训练模型参数,使模型适应特定应用场景。

适用场景

  • 目标任务与预训练任务相似但数据量较少
  • 需要模型适应特定领域(医疗、法律、金融)
  • 需要模型遵循特定输出格式

传统微调 vs 现代微调

维度传统微调现代指令微调
数据格式单任务标注多任务指令-输出对
目标任务性能指令遵循 + 泛化
典型方法全参数更新LoRA等PEFT方法

有监督微调(SFT / Supervised Fine-Tuning)

定义:使用人工标注的(指令,输出)数据对对预训练模型进行微调,是RLHF流程中的重要步骤。

数据构成

  • 用户指令(Instruction)
  • 上下文(Context,可选)
  • 期望输出(Output)
  • 辅助信息(如思维链推理过程)

示例数据格式

{
  "instruction": "解释量子计算的基本原理",
  "input": "",
  "output": "量子计算利用量子力学原理进行计算。其核心概念包括:\n1. 量子比特(Qubit):不同于经典比特的0或1,量子比特可以处于叠加态..."
}

人类反馈强化学习(RLHF / Reinforcement Learning from Human Feedback)

定义:结合人类偏好反馈与强化学习(PPO算法)的训练方法,使模型输出符合人类价值观和偏好。

三阶段流程

┌─────────────────┐    ┌─────────────────┐    ┌─────────────────┐
│   阶段1:SFT    │ → │  阶段2:奖励模型  │ → │  阶段3:RL训练   │
│  监督微调训练   │    │   学习人类偏好   │    │   PPO优化策略   │
└─────────────────┘    └─────────────────┘    └─────────────────┘
  1. SFT阶段:使用高质量指令数据微调基础模型
  2. 奖励模型训练:对同一提示的多个输出进行人工排序,训练奖励模型预测人类偏好
  3. PPO强化学习:使用奖励模型作为奖励函数,通过PPO算法优化策略模型

替代方案

  • DPO(Direct Preference Optimization):直接用偏好数据优化,无需显式奖励模型
  • RLAIF:使用AI反馈替代人类反馈,降低成本

3.2 参数高效微调(PEFT / Parameter-Efficient Fine-Tuning)

定义:在保持大部分预训练参数不变的情况下,通过引入少量可训练参数来适配下游任务的技术。

优势

  • 显存需求降低90%以上
  • 训练速度提升数倍
  • 可训练参数可独立保存(每个任务仅几十MB)
  • 避免灾难性遗忘

低秩适应(LoRA / Low-Rank Adaptation)

定义:通过低秩矩阵分解注入可训练参数,在不修改基础大模型参数的前提下实现高效适配。

数学原理: 对于预训练权重矩阵 $W_0 \in \mathbb{R}^{d imes k}$,LoRA引入低秩分解:

W = W_0 + ΔW = W_0 + BA

其中 $B \in \mathbb{R}^{d imes r}$,$A \in \mathbb{R}^{r imes k}$,$r \ll \min(d,k)$(秩通常为8-64)

配置参数

  • r(秩):控制低秩矩阵的维度,越大表达能力越强
  • lora_alpha:缩放参数,实际缩放为 lora_alpha / r
  • target_modules:应用LoRA的模块(通常为q_proj, v_proj等注意力层)

训练资源对比

方法可训练参数显存需求存储需求
全量微调100%高(需多卡)大(GB级)
LoRA0.1%-1%低(单卡可行)小(MB级)

QLoRA(Quantized LoRA)

定义:结合4-bit量化和LoRA的技术,进一步降低显存需求,使得在消费级GPU上微调大模型成为可能。

关键技术

  • 4-bit NormalFloat量化:信息论最优的4-bit数据类型
  • 双量化:对量化常数进行二次量化
  • 分页优化器:使用NVIDIA统一内存避免梯度检查点内存峰值

效果:可在单张24GB显存GPU上微调65B参数模型


3.3 模型压缩与推理优化

量化(Quantization)

定义:将模型参数从高精度(如FP32)转换为低精度(如INT8、INT4),显著降低存储需求和计算复杂度。

量化精度对比

精度位数相对存储典型应用
FP3232位100%训练默认精度
FP16/BF1616位50%混合精度训练
INT88位25%推理加速
INT4/FP44位12.5%极致压缩
NF44位12.5%QLoRA训练

量化方法

  • PTQ(训练后量化):直接量化预训练模型,无需重新训练
  • QAT(量化感知训练):在训练中模拟低精度,精度损失更小
  • GPTQ/AWQ:针对LLM的专用量化方法,保持生成质量

知识蒸馏(Knowledge Distillation)

定义:将大模型(教师模型)的知识迁移到小模型(学生模型),通过让小模型学习大模型的输出分布,兼顾性能与效率。

蒸馏类型

  1. 白盒蒸馏:可访问教师模型内部表示(隐藏层、注意力矩阵)
  2. 黑盒蒸馏:仅可访问教师模型输出(API调用)
  3. 自蒸馏:同一模型的不同视图或不同时间步

损失函数

L = α * L_hard(硬标签交叉熵) + (1-α) * L_soft(软标签KL散度)

温度参数T:控制软标签的平滑程度,T越高分布越平缓,传递更多暗知识


剪枝(Pruning)

定义:去除神经网络中冗余的权重或神经元,简化模型结构。

剪枝类型

  • 非结构化剪枝:逐个移除权重,需要硬件支持稀疏计算
  • 结构化剪枝:移除整个通道、层或注意力头,保持密集计算效率
  • 半结构化剪枝:如N:M稀疏模式(每M个权重保留N个),GPU友好

剪枝策略

  • 幅度剪枝:移除绝对值最小的权重
  • 重要性剪枝:基于梯度或Hessian矩阵评估重要性
  • 彩票假说(Lottery Ticket Hypothesis):随机初始化中存在稀疏子网络可达到原网络性能

四、推理与应用技术

4.1 提示工程(Prompt Engineering)

定义:设计和优化输入提示以引导大语言模型生成期望输出的技术。提示的质量直接影响模型表现。

提示核心要素

  1. 指令(Instruction):明确告诉模型要做什么
  2. 上下文(Context):提供背景信息
  3. 输入数据(Input Data):具体处理对象
  4. 输出指示器(Output Indicator):指定输出格式
  5. 角色扮演(Role):设定模型身份(专家、助手等)

零样本提示(Zero-shot Prompting)

定义:只向模型提供任务描述或问题,不提供任何示例的提示方法,完全依赖模型的泛化能力。

适用场景

  • 简单明确的任务
  • 模型已具备相关能力
  • 快速原型验证

示例

将以下英文翻译成中文:
"The future of AI is promising."

少样本提示(Few-shot Prompting)

定义:在提示中提供少量示例(通常为1-10个),引导模型理解任务模式并生成符合期望的输出。

示例(情感分析)

判断以下评论的情感倾向(正面/负面):

评论:"这部电影太棒了,强烈推荐!"
情感:正面

评论:"完全浪费时间,剧情混乱。"
情感:负面

评论:"演员表演出色,但剧本有待改进。"
情感:

最佳实践

  • 示例应具有代表性
  • 输入-输出格式保持一致
  • 示例顺序可能影响模型偏见(近期示例权重更高)

思维链(CoT / Chain of Thought)

定义:通过引导模型生成中间推理步骤(如"让我们一步步思考...")来提升复杂问题解决能力的提示技术。

标准CoT vs 自一致性CoT

类型方法效果
Zero-shot CoT添加"Let's think step by step"基础推理能力激活
Few-shot CoT提供含推理过程的示例更准确的推理模式
Self-Consistency多次采样,选择最一致答案提升复杂问题准确性

示例(数学问题)

问题:一个农场有鸡和兔共35只,脚共94只。鸡兔各几只?

让我们一步步思考:
1. 设鸡有x只,兔有y只
2. 根据题意:x + y = 35(总头数)
3. 2x + 4y = 94(总脚数,鸡2脚,兔4脚)
4. 从方程1得:x = 35 - y
5. 代入方程2:2(35-y) + 4y = 94
6. 70 - 2y + 4y = 94 → 2y = 24 → y = 12
7. 所以兔12只,鸡23只

思想树(ToT / Tree of Thoughts)

定义:思维链的泛化形式,允许模型同时探索多个不同的推理路径,通过评估和回溯找到最优解决方案。

工作流程

  1. 分解:将问题分解为多个思考步骤
  2. 生成:每个步骤生成多个候选思路
  3. 评估:使用LLM或启发式函数评估各思路
  4. 搜索:使用BFS或DFS搜索最佳路径
  5. 回溯:当路径不佳时回退尝试其他选择

适用场景

  • 需要探索的开放式问题
  • 创意写作
  • 数学证明
  • 游戏策略

4.2 增强与扩展技术

检索增强生成(RAG / Retrieval-Augmented Generation)

定义:使大语言模型能够从外部数据源检索并集成新信息的技术,将检索系统与生成模型结合。

架构流程

用户查询 → 向量化 → 向量检索 → 获取相关文档 → 构建增强提示 → LLM生成回答

RAG vs 微调对比

维度RAG微调
知识更新实时更新(换文档即可)需重新训练
hallucination显著降低(有事实依据)依赖训练数据质量
透明度可追溯来源黑盒
成本低(无需训练)高(需计算资源)
适用场景知识密集型任务风格/行为定制

高级RAG技术

  • 重排序(Re-ranking):使用更精确模型对检索结果二次排序
  • 查询重写(Query Rewriting):优化查询以提高检索质量
  • 混合检索:结合向量检索和关键词检索
  • 图RAG:利用知识图谱增强上下文

模型上下文协议(MCP / Model Context Protocol)

定义:Anthropic于2024年提出的开放协议,标准化AI模型与外部数据源、工具之间的连接方式。

核心理念

  • 类似"AI模型的USB-C接口"
  • 统一接口连接各种数据源和工具
  • 解决LLM与外部系统集成的碎片化问题

架构组件

  1. MCP服务器:封装数据源或工具,提供标准接口
  2. MCP客户端:LLM应用中的协议实现
  3. 传输层:支持stdio(本地)或HTTP SSE(远程)

支持的数据源类型

  • 本地文件系统
  • 数据库(PostgreSQL、SQLite等)
  • 企业系统(Slack、GitHub、Google Drive等)
  • 自定义API

代理(Agent / AI Agent)

定义:具有自主决策能力、能够执行复杂任务的AI系统,能够规划、推理、使用工具、与环境交互并根据反馈调整行为。

典型架构(ReAct模式)

Thought(思考)→ Action(行动)→ Observation(观察)→ ... → Answer(回答)

核心模块

  1. 规划(Planning):分解任务,制定执行计划
  2. 记忆(Memory)
    • 短期记忆:对话历史、上下文
    • 长期记忆:知识库、经验存储
  3. 工具使用(Tool Use):调用外部API、代码执行、数据库查询
  4. 反思(Reflection):评估执行结果,自我修正

代理类型

  • 单代理:单一LLM自主完成任务
  • 多代理(Multi-Agent):多个代理协作,各负责不同子任务
  • 层级代理:高层代理规划,低层代理执行

五、关键现象与挑战

5.1 涌现能力(Emergent Abilities)

定义:当模型规模达到特定阈值时突然出现的意外能力,这些能力在小模型中不存在,在大模型中突然出现。

典型涌现能力

  • 上下文学习:无需梯度更新,仅通过提示中的示例学习新任务
  • 指令遵循:理解并执行自然语言指令
  • 思维链推理:生成中间推理步骤解决复杂问题
  • 多步算术:执行多步骤数学计算

规模阈值现象: 研究表明,某些能力仅在模型参数量超过特定阈值(如100B)时才出现,呈现相变(Phase Transition)特征。


5.2 幻觉(Hallucination)

定义:大模型生成看似合理但实际上不准确或虚构的信息的现象,是文本生成任务中的常见问题。

幻觉类型

  • 事实性幻觉:生成与事实不符的内容(如错误的历史日期)
  • 忠实性幻觉:生成与输入或上下文不一致的内容(如摘要偏离原文)

缓解策略

  1. RAG:提供外部知识源
  2. 事实核查:后处理验证生成内容
  3. 训练数据清洗:减少训练数据中的错误信息
  4. RLHF:训练模型表达不确定性
  5. 检索增强生成:强制基于检索内容回答

5.3 灾难性遗忘(Catastrophic Forgetting)

定义:模型在微调新任务时遗忘旧任务知识的问题,是多任务学习和持续学习中的核心挑战。

发生机制

  • 神经网络参数在微调时被完全覆盖
  • 新任务梯度更新破坏旧任务的参数配置

解决方案

  • 弹性权重巩固(EWC):限制重要参数的变化
  • 记忆回放(Replay):混合旧任务样本进行训练
  • 模块化架构:不同任务使用不同子网络
  • 参数高效微调(LoRA等):冻结主干,仅更新少量参数

5.4 上下文学习(In-Context Learning)

定义:大模型无需参数更新,仅通过提示中提供的示例或上下文就能适应新任务的能力。

关键发现

  • 示例数量、顺序、格式都影响学习效果
  • 示例标签正确性不如示例格式重要(随机标签也能部分有效)
  • 模型规模越大,上下文学习能力越强

与梯度学习的区别

特性上下文学习梯度学习(微调)
参数更新
计算成本低(推理时)高(训练时)
持久性单次对话有效永久改变模型
数据需求几个示例大量数据

六、硬件与基础设施

6.1 AI加速器

GPU(Graphics Processing Unit)

定义:图形处理器,深度学习训练的主要计算设备,擅长并行计算。

主流AI GPU

  • NVIDIA A100/H100:数据中心级,支持大规模分布式训练
  • NVIDIA RTX 4090:消费级,适合小规模微调
  • AMD MI300X:NVIDIA竞品,大显存优势

关键指标

  • 显存容量(决定可训练模型规模)
  • 张量核心(Tensor Core)性能
  • NVLink互联带宽(多卡通信)

TPU(Tensor Processing Unit)

定义:Google开发的专用AI加速器,针对张量运算优化,用于大规模模型训练。

版本演进

  • TPU v1:仅推理
  • TPU v2/v3:支持训练,v3性能是v2的2倍
  • TPU v4/v5:更高性能,支持更大规模集群

架构特点

  • 脉动阵列(Systolic Array):优化矩阵乘法
  • 高带宽内存(HBM):提供充足内存带宽
  • Torus网络拓扑:高效的多芯片互联

NPU(Neural Processing Unit)

定义:神经网络处理器,专为AI推理设计的低功耗芯片,常见于移动设备。

应用场景

  • 手机端侧AI(拍照优化、语音助手)
  • 智能摄像头
  • 自动驾驶边缘计算

代表产品

  • Apple Neural Engine
  • 华为昇腾(Ascend)
  • 高通Hexagon

6.2 分布式训练

数据并行(Data Parallelism)

定义:将数据批次分割到多个设备,每个设备持有完整模型副本,梯度聚合后同步更新。

实现方式

  • DDP(DistributedDataParallel):PyTorch标准方案
  • Horovod:Uber开源,支持多种框架

模型并行(Model Parallelism)

定义:将模型参数分割到多个设备,每个设备处理部分层或部分参数。

适用场景

  • 模型太大无法放入单卡显存
  • 流水线并行和张量并行

ZeRO(Zero Redundancy Optimizer)

定义:DeepSpeed提出的优化器状态、梯度和参数分区技术,实现万亿参数模型训练。

三个阶段

  • ZeRO-1:仅分区优化器状态
  • ZeRO-2:分区优化器状态+梯度
  • ZeRO-3:分区优化器状态+梯度+参数

效果:单卡可训练模型规模提升数倍


6.3 向量数据库

定义:专门用于存储和检索高维向量(嵌入)的数据库,是RAG系统的关键组件。

核心能力

  • 相似度搜索:基于余弦相似度或欧氏距离
  • 近似最近邻(ANN):平衡搜索速度和精度
  • 混合查询:结合向量相似度和元数据过滤

主流产品

  • 开源:Milvus、Weaviate、Qdrant、Chroma
  • 云服务:Pinecone、Azure Cognitive Search

七、内容生产模式演进

7.1 四代内容生产模式对比

模式英文全称核心特征代表平台/工具质量成本
PGCProfessional Generated Content专业团队、精品化、高成本电视台、报社、好莱坞
UGCUser Generated Content用户自发、海量、多元YouTube、抖音、微博参差不齐
PUGCProfessional User Generated Content专业背景用户、垂直深度B站UP主、知乎大V中高
AIGCAI Generated ContentAI自动生成、高效率、个性化ChatGPT、Midjourney、Sora可调极低

7.2 AIGC技术栈映射

文本生成:GPT-4、Claude、LLaMA → 文章、代码、诗歌、报告
图像生成:DALL-E 3、Midjourney、Stable Diffusion → 插画、设计、摄影
音频生成:Suno、ElevenLabs → 音乐、配音、有声书
视频生成:Sora、Runway Gen-2 → 短片、动画、特效
3D生成:DreamFusion、Point-E → 模型、场景、游戏资产

八、附录:术语速查表

8.1 按应用场景分类

模型架构类: Transformer、BERT、GPT、T5、LLaMA、PaLM、MoE、RNN、LSTM、MLP

训练技术类: Pre-training、Fine-tuning、SFT、RLHF、LoRA、QLoRA、PEFT、Quantization、Distillation、Pruning

推理应用类: Prompt Engineering、CoT、ToT、RAG、Agent、MCP、Zero-shot、Few-shot

多模态类: CLIP、VLM、DALL-E、Stable Diffusion、AIGC、GAN

基础设施类: GPU、TPU、NPU、ZeRO、Vector DB、FP16/INT8

8.2 关键论文与资源

术语里程碑论文/资源年份
Transformer"Attention Is All You Need"2017
BERT"BERT: Pre-training of Deep Bidirectional Transformers"2018
GPT-3"Language Models are Few-Shot Learners"2020
RLHF"Training language models to follow instructions with human feedback"2022
LoRA"LoRA: Low-Rank Adaptation of Large Language Models"2021
RAG"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks"2020
CLIP"Learning Transferable Visual Models From Natural Language Supervision"2021

 

     

    更多推荐