大模型AI-入门-发展历程-深度学习
部分内容可能来自网络或者由AI生成。
如有雷同,纯属巧合,仅供学习参考之用。
深度学习(Deep Learning)
深度学习是机器学习的重要分支,通过模拟人脑神经网络的结构与工作机制,实现了对复杂、非结构化数据(如图像、语音、文本)的高效建模。它不仅大幅减少了对人工特征工程的依赖,还在众多领域取得了突破性成果。
一、为什么需要深度学习?
传统机器学习的局限
-
依赖人工特征工程:需专家手动设计特征(如SIFT、HOG用于图像),耗时且难以泛化。
-
难以建模复杂非线性关系:面对高维、非结构化数据(如像素、音频波形、句子),线性模型或浅层模型表达能力有限。
-
端到端学习能力弱:无法直接从原始输入到最终输出进行联合优化。
深度学习的优势
✅ 自动特征提取:通过多层网络逐层抽象,从原始数据中自动学习层次化特征(如边缘 → 部件 → 物体)。 ✅ 强大的非线性拟合能力:借助激活函数和深层结构,可逼近任意复杂函数。 ✅ 端到端训练:输入原始数据,直接输出预测结果,中间过程由模型自动学习。 ✅ 适用于大规模数据:数据越多,模型性能提升越显著(“数据飞轮”效应)。
🌟 典型应用:图像识别(ResNet)、语音识别(WaveNet)、机器翻译(Transformer)、大语言模型(GPT、LLaMA)。
二、深度学习的核心:神经网络基础
1. 神经网络的基本组成
| 组件 | 说明 |
|---|---|
| 神经元(节点) | 基本计算单元,接收输入,加权求和后经激活函数输出 |
| 连线(权重) | 连接神经元的边,携带权重参数 $ w $,决定信号传递强度 |
| 偏置(Bias) | 每个神经元的可学习偏移量 $ b $,增强模型灵活性 |
数学表达(单个神经元):
z=∑_i=1nw_ix_i+b,a=σ(z)z = \sum\_{i=1}^{n} w\_i x\_i + b,\quad a = \sigma(z)z=∑_i=1nw_ix_i+b,a=σ(z)
其中 $ \sigma $ 为激活函数,$ a $ 为输出。
2. 网络分层结构
典型的前馈神经网络(Feedforward Neural Network)包含三层:
| 层级 | 功能 | 神经元数量确定方式 |
|---|---|---|
| 输入层(Input Layer) | 接收原始特征 | = 输入特征维度 (如 28×28 图像 → 784 个神经元) |
| 隐藏层(Hidden Layers) | 特征提取与转换 (可有多层,“深度”由此而来) | 经验+实验: - 前层较多 → 捕捉细节 - 后层较少 → 抽象压缩 - 常见选择:128, 256, 512 |
| 输出层(Output Layer) | 生成最终预测 | 取决于任务类型: - 多分类:= 类别数(如手写数字 0–9 → 10) - 二分类/回归:= 1 |
💡 “深度” ≠ 越深越好:过深易导致梯度消失/爆炸、训练困难,需配合残差连接(ResNet)、归一化等技术。
3. 激活函数:引入非线性
若无激活函数,多层网络等价于单层线性变换,无法学习复杂模式。
| 激活函数 | 公式 | 输出范围 | 特点 | 常用场景 |
|---|---|---|---|---|
| ReLU | $ \max(0, x) $ | 计算简单、缓解梯度消失 | 隐藏层首选 | |
| Sigmoid | $ \frac{1}{1+e^{-x}} $ | 平滑、可解释为概率 | 二分类输出层 | |
| Softmax | $ \frac{e^{x_i}}{\sum_j e^{x_j}} $ | 多分类概率分布 | 多分类输出层 | |
| Tanh | $ \frac{e^x - e{-x}}{ex + e^{-x}} $ | 零中心化 | RNN 中曾常用 |
⚠️ ReLU 的“死亡神经元”问题可通过 Leaky ReLU、ELU 等变体缓解。
三、Transformer 与深度学习框架
1. Transformer:革命性的架构
-
提出时间:2017年《Attention is All You Need》
-
核心机制:自注意力(Self-Attention)
-
允许模型在处理序列时,动态关注所有位置的相关信息
-
解决了 RNN 的长程依赖和并行化难题
-
-
应用:NLP(BERT、GPT)、CV(ViT)、语音、多模态等
-
本质:一种模型架构设计理念,而非具体工具
三、总结:深度学习的关键认知
| 维度 | 核心要点 |
|---|---|
| 本质 | 通过多层非线性变换自动学习数据表示 |
| 优势 | 端到端、自动特征提取、适合非结构化数据 |
| 关键组件 | 神经元、权重、激活函数、损失函数、优化器 |
| 训练流程 | 数据 → 模型定义 → 编译 → 训练 → 评估 → 预测 |
| 架构演进 | MLP → CNN/RNN → Transformer → 大模型 |
| 工具选择 | 研究用 PyTorch,生产用 TensorFlow(或两者结合) |
模型分类
一、核心概念:模型架构 vs 具体模型
| 概念 | 定义 | 类比 | 示例 |
|---|---|---|---|
| 模型架构(Model Architecture) | 模型的“设计蓝图”,定义了网络结构、计算逻辑和数据流(无参数) | 建筑设计图 | CNN、Transformer、RNN |
| 具体模型(Trained Model) | 基于某架构,在特定数据上训练后得到的带参数的实例,可直接用于预测 | 建成的房子 | GPT-4(基于Transformer)、ResNet-50(基于CNN) |
二、主流模型架构及典型代表
1. 卷积神经网络(CNNs)
适用任务:图像、视频等网格结构数据核心机制:卷积核滑动提取局部空间特征,池化降维,全连接分类
| 模型 | 贡献 | 应用场景 |
|---|---|---|
| LeNet-5 | 首个成功CNN,用于手写数字识别 | MNIST 分类 |
| AlexNet | 引入ReLU、Dropout,引爆深度学习热潮 | ImageNet 图像分类 |
| VGGNet | 使用小卷积核堆叠,证明“深度”重要性 | 特征提取 backbone |
| ResNet | 残差连接解决梯度消失,支持上千层 | 图像分类、目标检测 |
| EfficientNet | 复合缩放(深度/宽度/分辨率)优化性能 | 移动端高效模型 |
| YOLO | 单阶段目标检测,实时性强 | 自动驾驶、安防监控 |
🖼️ CNN 优势:平移不变性、参数共享、局部感知 → 适合图像。
2. 循环神经网络(RNNs)
适用任务:文本、语音、时间序列等序列数据核心机制:隐藏状态传递历史信息,建模时序依赖
| 模型 | 改进点 | 特点 |
|---|---|---|
| 标准 RNN | 基础循环结构 | 存在梯度消失,难以处理长序列 |
| LSTM | 引入遗忘门、输入门、输出门 | 有效缓解梯度消失,长期记忆强 |
| GRU | 简化LSTM(合并门控) | 计算更快,性能接近LSTM |
| Bi-RNN | 双向处理(前向+后向) | 捕捉上下文双向信息 |
⏳ RNN 局限:串行计算 → 无法并行;长程依赖仍弱于 Transformer。
3. Transformer
适用任务:NLP、CV、语音、多模态等通用序列建模核心机制:自注意力(Self-Attention) + 位置编码,实现全局依赖建模与并行计算
| 模型 | 架构特点 | 典型应用 |
|---|---|---|
| 原始 Transformer | Encoder-Decoder 结构 | 机器翻译 |
| BERT | 仅 Encoder,双向上下文预训练 | 文本分类、问答、NER |
| GPT 系列 | 仅 Decoder,自回归生成 | 对话、创作、代码生成 |
| Vision Transformer (ViT) | 将图像分块转为序列 | 图像分类(媲美 CNN) |
| DETR | Transformer + Object Queries | 端到端目标检测 |
4. 生成对抗网络(GANs)
适用任务:图像生成、风格迁移、数据增强 核心机制:生成器(Generator) 与 判别器(Discriminator) 对抗训练
| 模型 | 创新点 | 效果 |
|---|---|---|
| 原始 GAN | Minimax 对抗框架 | 基础生成能力 |
| DCGAN | 引入卷积层 | 生成更清晰图像 |
| StyleGAN | 解耦风格与内容控制 | 高质量人脸生成(可调年龄、发型等) |
| CycleGAN | 无配对图像转换 | 马 ↔ 斑马、照片 ↔ 油画 |
| BigGAN | 大规模训练 + 正则化 | 高分辨率、多样性图像生成 |
🎨 GAN 本质:通过“造假-识假”博弈,逼出逼真数据。
5. 图神经网络(GNNs)
适用任务:社交网络、知识图谱、分子结构等图结构数据核心机制:节点通过邻居信息聚合更新自身表示(Message Passing)
| 模型 | 机制 | 优势 |
|---|---|---|
| GCN | 图卷积(加权平均邻居) | 简单高效 |
| GAT | 引入注意力机制 | 动态分配邻居权重 |
| GraphSAGE | 采样固定数量邻居 | 支持大规模图训练 |
🌐 GNN 核心思想:“你是你朋友的平均” → 节点表征 = 邻居信息聚合。
三、模型架构适用场景总结
| 任务类型 | 推荐架构 | 代表模型 |
|---|---|---|
| 计算机视觉 | CNN / Vision Transformer | ResNet, ViT, YOLO |
| 自然语言处理 | Transformer / RNN | BERT, GPT, LSTM |
| 序列/时间数据 | RNN / Transformer | GRU, Informer, TimesNet |
| 生成任务 | GAN / Diffusion / VAE | StyleGAN, Stable Diffusion |
| 图结构数据 | GNN | GCN, GAT |
| 多模态融合 | Transformer-based | CLIP, LLaVA, Flamingo |
💡 趋势:Transformer 正在成为“通用骨干网络”,逐步统一各领域。
四、预训练模型(Pre-trained Models)
什么是预训练模型?
在大规模通用数据集(如 Wikipedia、ImageNet)上训练好的模型,已学习到通用特征或知识,可直接使用或微调。
常见预训练模型示例
-
NLP:BERT、GPT、RoBERTa、LLaMA、Qwen、DeepSeek
-
CV:ResNet-101、VGG16、ViT-Base
-
多模态:CLIP、BLIP、Flamingo
获取平台
-
Hugging Face Hub(最主流)
-
TensorFlow Hub
-
PyTorch Hub
-
ModelScope(魔搭,阿里)
✅ 优势:避免从零训练,节省算力与时间,提升小数据任务性能。
五、微调(Fine-tuning)技术
微调是在预训练模型基础上,针对特定任务进行少量训练,使其适配新场景。
1. 标准微调(Standard Fine-tuning)
-
方法:解冻全部或部分层,用目标任务数据继续训练
-
优点:简单有效,性能好
-
缺点:大模型全量微调成本高(如 70B 模型需数百 GPU)
2. 监督微调(Supervised Fine-Tuning, SFT)
-
特点:使用有标签数据进行微调
-
应用:分类、NER、机器翻译等监督任务
-
关键:高质量标注数据决定上限
3. 低秩适配(LoRA, Low-Rank Adaptation)
-
原理:冻结原模型权重,仅训练低秩分解矩阵(如 $ \Delta W = A \times B ,,, A,B $ 低秩)
-
优势:
-
新增参数 < 1%
-
显存占用低
-
可插拔(同一基座支持多任务适配器)
-
-
应用:大模型高效微调(如 Llama-2 + LoRA)
📐 低秩矩阵解释: 若原权重矩阵为 1024×1024(满秩),LoRA 用两个 1024×8 矩阵近似 → 参数减少 64 倍!
4. 知识蒸馏(Knowledge Distillation)
-
目标:将大模型(教师)知识迁移到小模型(学生)
-
方法:学生模型学习教师的软标签(soft logits) 或中间特征
-
价值:
-
模型压缩(70B → 7B)
-
提升小模型性能
-
降低推理成本
-
⚠️ 争议案例: DeepSeek-R1(671B)以极低成本训练,被质疑使用蒸馏“窃取”GPT-4知识,但其论文《Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》表明其采用强化学习+合成数据,非直接蒸馏。
六、Hugging Face:AI 开发者的“GitHub”
Hugging Face 已成为 AI 领域的事实标准平台,提供:
| 功能 | 说明 |
|---|---|
| 模型库 | 10万+ 预训练模型(Transformers 库支持一键加载) |
| 数据集 | 5万+ 公开数据集(datasets 库支持流式加载) |
| 工具链 | Tokenizers、Accelerate、PEFT(含 LoRA)、TRL(强化学习) |
| Spaces | 一键部署 Gradio/Streamlit Demo(无需服务器) |
| 社区生态 | 开源、文档完善、企业支持(如 AWS、Google 集成) |
七、总结:模型演进与未来方向
| 阶段 | 特点 | 代表 |
|---|---|---|
| 手工特征时代 | 依赖专家设计特征 | SIFT + SVM |
| 浅层学习时代 | 自动学习简单模式 | MLP、SVM |
| 深度学习时代 | 自动层次化特征学习 | CNN、RNN |
| 大模型时代 | 预训练 + 微调 + 对齐 | GPT、LLaMA、DeepSeek |
更多推荐
所有评论(0)