部分内容可能来自网络或者由AI生成。
如有雷同,纯属巧合,仅供学习参考之用。

深度学习(Deep Learning)

深度学习是机器学习的重要分支,通过模拟人脑神经网络的结构与工作机制,实现了对复杂、非结构化数据(如图像、语音、文本)的高效建模。它不仅大幅减少了对人工特征工程的依赖,还在众多领域取得了突破性成果。


一、为什么需要深度学习?

传统机器学习的局限

  • 依赖人工特征工程:需专家手动设计特征(如SIFT、HOG用于图像),耗时且难以泛化。

  • 难以建模复杂非线性关系:面对高维、非结构化数据(如像素、音频波形、句子),线性模型或浅层模型表达能力有限。

  • 端到端学习能力弱:无法直接从原始输入到最终输出进行联合优化。

深度学习的优势

自动特征提取:通过多层网络逐层抽象,从原始数据中自动学习层次化特征(如边缘 → 部件 → 物体)。 ✅ 强大的非线性拟合能力:借助激活函数和深层结构,可逼近任意复杂函数。 ✅ 端到端训练:输入原始数据,直接输出预测结果,中间过程由模型自动学习。 ✅ 适用于大规模数据:数据越多,模型性能提升越显著(“数据飞轮”效应)。

🌟 典型应用:图像识别(ResNet)、语音识别(WaveNet)、机器翻译(Transformer)、大语言模型(GPT、LLaMA)。


二、深度学习的核心:神经网络基础

1. 神经网络的基本组成

组件说明
神经元(节点)基本计算单元,接收输入,加权求和后经激活函数输出
连线(权重)连接神经元的边,携带权重参数 $ w $,决定信号传递强度
偏置(Bias)每个神经元的可学习偏移量 $ b $,增强模型灵活性

数学表达(单个神经元):

z=∑_i=1nw_ix_i+b,a=σ(z)z = \sum\_{i=1}^{n} w\_i x\_i + b,\quad a = \sigma(z)z=_i=1nw_ix_i+b,a=σ(z)

其中 $ \sigma $ 为激活函数,$ a $ 为输出。

2. 网络分层结构

典型的前馈神经网络(Feedforward Neural Network)包含三层:

层级功能神经元数量确定方式
输入层(Input Layer)接收原始特征= 输入特征维度
(如 28×28 图像 → 784 个神经元)
隐藏层(Hidden Layers)特征提取与转换
(可有多层,“深度”由此而来)
经验+实验:
- 前层较多 → 捕捉细节
- 后层较少 → 抽象压缩
- 常见选择:128, 256, 512
输出层(Output Layer)生成最终预测取决于任务类型:
- 多分类:= 类别数(如手写数字 0–9 → 10)
- 二分类/回归:= 1

💡 “深度” ≠ 越深越好:过深易导致梯度消失/爆炸、训练困难,需配合残差连接(ResNet)、归一化等技术。


3. 激活函数:引入非线性

若无激活函数,多层网络等价于单层线性变换,无法学习复杂模式。

激活函数公式输出范围特点常用场景
ReLU$ \max(0, x) $计算简单、缓解梯度消失隐藏层首选
Sigmoid$ \frac{1}{1+e^{-x}} $平滑、可解释为概率二分类输出层
Softmax$ \frac{e^{x_i}}{\sum_j e^{x_j}} $多分类概率分布多分类输出层
Tanh$ \frac{e^x - e{-x}}{ex + e^{-x}} $零中心化RNN 中曾常用

⚠️ ReLU 的“死亡神经元”问题可通过 Leaky ReLU、ELU 等变体缓解。


三、Transformer 与深度学习框架

1. Transformer:革命性的架构

  • 提出时间:2017年《Attention is All You Need》

  • 核心机制自注意力(Self-Attention)

    • 允许模型在处理序列时,动态关注所有位置的相关信息

    • 解决了 RNN 的长程依赖和并行化难题

  • 应用:NLP(BERT、GPT)、CV(ViT)、语音、多模态等

  • 本质:一种模型架构设计理念,而非具体工具

三、总结:深度学习的关键认知

维度核心要点
本质通过多层非线性变换自动学习数据表示
优势端到端、自动特征提取、适合非结构化数据
关键组件神经元、权重、激活函数、损失函数、优化器
训练流程数据 → 模型定义 → 编译 → 训练 → 评估 → 预测
架构演进MLP → CNN/RNN → Transformer → 大模型
工具选择研究用 PyTorch,生产用 TensorFlow(或两者结合)

模型分类

一、核心概念:模型架构 vs 具体模型

概念定义类比示例
模型架构(Model Architecture)模型的“设计蓝图”,定义了网络结构、计算逻辑和数据流(无参数建筑设计图CNN、Transformer、RNN
具体模型(Trained Model)基于某架构,在特定数据上训练后得到的带参数的实例,可直接用于预测建成的房子GPT-4(基于Transformer)、ResNet-50(基于CNN)

二、主流模型架构及典型代表

1. 卷积神经网络(CNNs)

适用任务:图像、视频等网格结构数据核心机制:卷积核滑动提取局部空间特征,池化降维,全连接分类

模型贡献应用场景
LeNet-5首个成功CNN,用于手写数字识别MNIST 分类
AlexNet引入ReLU、Dropout,引爆深度学习热潮ImageNet 图像分类
VGGNet使用小卷积核堆叠,证明“深度”重要性特征提取 backbone
ResNet残差连接解决梯度消失,支持上千层图像分类、目标检测
EfficientNet复合缩放(深度/宽度/分辨率)优化性能移动端高效模型
YOLO单阶段目标检测,实时性强自动驾驶、安防监控

🖼️ CNN 优势:平移不变性、参数共享、局部感知 → 适合图像。


2. 循环神经网络(RNNs)

适用任务:文本、语音、时间序列等序列数据核心机制:隐藏状态传递历史信息,建模时序依赖

模型改进点特点
标准 RNN基础循环结构存在梯度消失,难以处理长序列
LSTM引入遗忘门、输入门、输出门有效缓解梯度消失,长期记忆强
GRU简化LSTM(合并门控)计算更快,性能接近LSTM
Bi-RNN双向处理(前向+后向)捕捉上下文双向信息

RNN 局限:串行计算 → 无法并行;长程依赖仍弱于 Transformer。


3. Transformer

适用任务:NLP、CV、语音、多模态等通用序列建模核心机制自注意力(Self-Attention) + 位置编码,实现全局依赖建模与并行计算

模型架构特点典型应用
原始 TransformerEncoder-Decoder 结构机器翻译
BERT仅 Encoder,双向上下文预训练文本分类、问答、NER
GPT 系列仅 Decoder,自回归生成对话、创作、代码生成
Vision Transformer (ViT)将图像分块转为序列图像分类(媲美 CNN)
DETRTransformer + Object Queries端到端目标检测

4. 生成对抗网络(GANs)

适用任务:图像生成、风格迁移、数据增强 核心机制生成器(Generator)判别器(Discriminator) 对抗训练

模型创新点效果
原始 GANMinimax 对抗框架基础生成能力
DCGAN引入卷积层生成更清晰图像
StyleGAN解耦风格与内容控制高质量人脸生成(可调年龄、发型等)
CycleGAN无配对图像转换马 ↔ 斑马、照片 ↔ 油画
BigGAN大规模训练 + 正则化高分辨率、多样性图像生成

🎨 GAN 本质:通过“造假-识假”博弈,逼出逼真数据。


5. 图神经网络(GNNs)

适用任务:社交网络、知识图谱、分子结构等图结构数据核心机制:节点通过邻居信息聚合更新自身表示(Message Passing)

模型机制优势
GCN图卷积(加权平均邻居)简单高效
GAT引入注意力机制动态分配邻居权重
GraphSAGE采样固定数量邻居支持大规模图训练

🌐 GNN 核心思想:“你是你朋友的平均” → 节点表征 = 邻居信息聚合。


三、模型架构适用场景总结

任务类型推荐架构代表模型
计算机视觉CNN / Vision TransformerResNet, ViT, YOLO
自然语言处理Transformer / RNNBERT, GPT, LSTM
序列/时间数据RNN / TransformerGRU, Informer, TimesNet
生成任务GAN / Diffusion / VAEStyleGAN, Stable Diffusion
图结构数据GNNGCN, GAT
多模态融合Transformer-basedCLIP, LLaVA, Flamingo

💡 趋势:Transformer 正在成为“通用骨干网络”,逐步统一各领域。


四、预训练模型(Pre-trained Models)

什么是预训练模型?

大规模通用数据集(如 Wikipedia、ImageNet)上训练好的模型,已学习到通用特征或知识,可直接使用或微调。

常见预训练模型示例

  • NLP:BERT、GPT、RoBERTa、LLaMA、Qwen、DeepSeek

  • CV:ResNet-101、VGG16、ViT-Base

  • 多模态:CLIP、BLIP、Flamingo

获取平台

  • Hugging Face Hub(最主流)

  • TensorFlow Hub

  • PyTorch Hub

  • ModelScope(魔搭,阿里)

优势:避免从零训练,节省算力与时间,提升小数据任务性能。


五、微调(Fine-tuning)技术

微调是在预训练模型基础上,针对特定任务进行少量训练,使其适配新场景。

1. 标准微调(Standard Fine-tuning)

  • 方法:解冻全部或部分层,用目标任务数据继续训练

  • 优点:简单有效,性能好

  • 缺点:大模型全量微调成本高(如 70B 模型需数百 GPU)

2. 监督微调(Supervised Fine-Tuning, SFT)

  • 特点:使用有标签数据进行微调

  • 应用:分类、NER、机器翻译等监督任务

  • 关键:高质量标注数据决定上限

3. 低秩适配(LoRA, Low-Rank Adaptation)

  • 原理:冻结原模型权重,仅训练低秩分解矩阵(如 $ \Delta W = A \times B ,, A,B $ 低秩)

  • 优势

    • 新增参数 < 1%

    • 显存占用低

    • 可插拔(同一基座支持多任务适配器)

  • 应用:大模型高效微调(如 Llama-2 + LoRA)

📐 低秩矩阵解释: 若原权重矩阵为 1024×1024(满秩),LoRA 用两个 1024×8 矩阵近似 → 参数减少 64 倍!

4. 知识蒸馏(Knowledge Distillation)

  • 目标:将大模型(教师)知识迁移到小模型(学生)

  • 方法:学生模型学习教师的软标签(soft logits) 或中间特征

  • 价值

    • 模型压缩(70B → 7B)

    • 提升小模型性能

    • 降低推理成本

⚠️ 争议案例: DeepSeek-R1(671B)以极低成本训练,被质疑使用蒸馏“窃取”GPT-4知识,但其论文《Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》表明其采用强化学习+合成数据,非直接蒸馏。


六、Hugging Face:AI 开发者的“GitHub”

Hugging Face 已成为 AI 领域的事实标准平台,提供:

功能说明
模型库10万+ 预训练模型(Transformers 库支持一键加载)
数据集5万+ 公开数据集(datasets 库支持流式加载)
工具链Tokenizers、Accelerate、PEFT(含 LoRA)、TRL(强化学习)
Spaces一键部署 Gradio/Streamlit Demo(无需服务器)
社区生态开源、文档完善、企业支持(如 AWS、Google 集成)

七、总结:模型演进与未来方向

阶段特点代表
手工特征时代依赖专家设计特征SIFT + SVM
浅层学习时代自动学习简单模式MLP、SVM
深度学习时代自动层次化特征学习CNN、RNN
大模型时代预训练 + 微调 + 对齐GPT、LLaMA、DeepSeek

更多推荐