深度学习概念

深度学习是机器学习的一个分支
核心:
通过构建多层神经网络实现自动特征提取和模式识别
特点:
多层非线性变换
自动特征提取
大数据和计算能力
可解释性差

常见深度学习模型

卷积神经网络(CNN)

核心思想: 利用卷积核在输入数据上滑动,提取局部特征。
关键组件:
卷积层:提取边缘、纹理、形状等特征
池化层:降维、减少计算量、增强平移不变性
全连接层:最终分类或回归
典型应用: 图像分类、目标检测、语义分割、医学影像分析
代表模型: LeNet → AlexNet → VGG → ResNet → EfficientNet

循环神经网络(RNN)

核心思想: 引入"记忆"机制,利用隐藏状态传递序列信息。
变体演进:
基础 RNN:梯度消失/爆炸问题严重,长序列难以记忆
LSTM:通过门控机制(输入门、遗忘门、输出门)选择性保留信息
GRU:LSTM 的简化版,参数量更少,训练更快
典型应用: 文本生成、机器翻译、语音识别、时间序列预测
现状: 在 NLP 领域已基本被 Transformer 取代,但在轻量级序列任务中仍有使用

自编码器(Autoencoders)

核心思想: 通过"压缩-重建"学习数据的紧凑表示。
结构:
编码器:将高维输入映射到低维潜在空间(Latent Space)
解码器:从潜在表示重建原始输入
主要变体:

变体 特点
去噪自编码器(DAE) 输入加噪声,学习鲁棒表示
变分自编码器(VAE) 潜在空间服从概率分布,可生成新样本
稀疏自编码器 限制神经元激活稀疏性

典型应用: 降维、特征提取、异常检测、图像去噪

生成对抗网络(GAN)

核心思想: 两个网络相互博弈——生成器造假,判别器鉴真。
训练动态:
生成器 G:输入随机噪声 → 生成假样本 → 试图骗过判别器
判别器 D:接收真样本和假样本 → 判断真假
最终达到纳什均衡:G 生成的样本足以以假乱真,D 无法区分。
典型应用: 图像生成、风格迁移、超分辨率、数据增强
代表模型: DCGAN → StyleGAN → BigGAN
局限: 训练不稳定、模式崩溃(Mode Collapse)

Transformer

核心思想: 完全基于自注意力机制(Self-Attention),摒弃循环和卷积。
关键创新:
自注意力:计算序列中每个位置与其他所有位置的关联权重
多头注意力:并行学习多组不同的注意力模式
位置编码:注入序列顺序信息
残差连接 + 层归一化:稳定深层训练
架构分支:

类型 结构 代表
编码器-only 双向注意力 BERT(理解任务)
解码器-only 因果(单向)注意力 GPT 系列(生成任务)
编码器-解码器 双向编码 + 因果解码 T5、原始 Transformer(翻译)

现状: 当前 NLP 和视觉领域的主流架构,大语言模型(LLM)的基础

深度强化学习(DRL)

核心思想: 结合深度神经网络与强化学习,让智能体在环境中通过试错学习最优策略。
关键要素:
状态(State):环境当前情况
动作(Action):智能体的行为
奖励(Reward):环境反馈的信号
策略(Policy):状态到动作的映射

算法 特点
DQN 用深度网络近似 Q 值函数
Policy Gradient 直接优化策略
Actor-Critic 结合值函数和策略梯度
PPO 当前最主流的稳定训练算法

典型应用: 游戏 AI(AlphaGo、AlphaStar)、机器人控制、自动驾驶、推荐系统

图神经网络(GNN)

核心思想: 将神经网络扩展到图结构数据(节点 + 边),通过消息传递机制聚合邻居信息。
核心操作——消息传递:
每个节点 ← 聚合(自身特征 + 邻居特征)
主要变体:

模型 核心机制
GCN 谱域卷积,归一化邻接矩阵
GraphSAGE 采样邻居,归纳式学习
GAT 引入注意力机制,为不同邻居分配权重
GIN 表达能力更强的聚合函数

典型应用: 社交网络分析、分子性质预测、知识图谱、推荐系统、交通流量预测

常见深度学习模型总结

模型 数据类型 核心能力 当前地位
CNN 网格数据(图像) 局部特征提取 视觉基础,但部分被 ViT 替代
RNN 序列数据 时序记忆 逐步被 Transformer 取代
自编码器 通用 表示学习/降维 作为组件广泛使用
GAN 通用 高质量生成 被 Diffusion 模型冲击
Transformer 序列/图/图像 全局依赖建模 当前主流架构
DRL 交互环境 序列决策 特定领域核心方法
GNN 图数据 关系推理 图领域标准方法

更多推荐