深度学习模型分类

1. 分类模型(Classification)

​典型模型​:

​CNN​:LeNet(手写数字分类)、ResNet(ImageNet图像分类)。

​Transformer​:BERT(文本分类)、ViT(图像分类)。

2.回归模型(Regression)

​目标​:预测连续数值(如房价、温度、销量)。

​典型模型​:

​线性回归​(传统ML,但可视为浅层神经网络)。

​MLP(多层感知机)​​:全连接层组成的神经网络(如预测用户评分)。

​CNN/LSTM​:结合结构特征(如图像中的房屋面积、文本中的时间序列)。

3. 生成模型(Generation)

​目标​:生成与训练数据分布一致的新数据(如图像、文本、音频)。

​典型模型​:

​GAN(生成对抗网络)​​(2014):通过生成器(Generator)与判别器(Discriminator)博弈,生成高保真图像(如StyleGAN生成人脸)。

​VAE(变分自编码器)​​(2013):通过概率建模生成数据(如生成手写数字)。

​扩散模型(Diffusion Models)​​(2020):通过逐步添加噪声再去噪的方式生成高质量图像(如Stable Diffusion、DALL·E 2)。

​Transformer生成模型​:GPT(文本生成)、MusicGen(音乐生成)。

4. 序列建模(Sequence Modeling)

5. 检测与分割模型(Detection & Segmentation)

深度学习框架:PyTorch(动态图)、TensorFlow(静态图)、JAX(自动微分+JIT编译)等 框架支撑模型,模型依赖框架  

深度学习典型模型:

卷积神经网络(CNN,图像)(ResNet等)、

循环神经网络(RNN,序列)、

Transformer(自然语言处理、多模态)(有bert gpt系列等)。

 

神经网络

一、神经元(Neuron):神经网络的基本单元

二、(Layer):神经网络的层级结构

1. 输入层(Input Layer)功能​:接收原始输入数据(如图像像素、文本词向量),并将其传递给下一层。

2. 隐藏层(Hidden Layer)​功能​:通过神经元的连接和非线性变换,从输入数据中提取抽象特征​(如图像的边缘、纹理,文本的语义)。

3. 输出层(Output Layer)功能​:将隐藏层的特征映射到目标任务的空间(如分类任务的类别概率、回归任务的连续值)。

三、核心层类型:按功能划分的关键模块

1. 全连接层(Fully Connected Layer, FC Layer)​结构​:每个神经元与前一层所有神经元全连接(权重矩阵 W∈R 

n×m,n为前一层神经元数,m为当前层神经元数)。

2. 卷积层(Convolutional Layer, Conv Layer)​结构​:通过卷积核(Filter)​在输入数据上滑动,提取局部空间特征(如图像的边缘、纹理)。

3. 循环层(Recurrent Layer, RNN Layer)结构​:通过隐藏状态(Hidden State)​传递序列信息,捕捉时间或顺序依赖(如文本中的上下文关系)。

4. 注意力层(Attention Layer)结构​:通过注意力机制(Attention)​动态计算输入序列中各元素的重要性权重,聚焦关键信息。

5. 池化层(Pooling Layer)结构​:通过下采样(Downsampling)​降低特征图的空间尺寸(如高度、宽度),减少计算量并增强平移不变性。

四、辅助模块:提升模型性能的关键组件

1. 激活函数(Activation Function)功能​:对神经元的线性输出进行非线性变换,引入“非线性能力”,使网络能学习复杂模式(如分段函数、指数关系)。

2. 正则化模块(Regularization)功能​:防止模型过拟合(在训练数据上表现好,但在新数据上泛化差),提升模型泛化能力。

3. 损失函数(Loss Function)功能​:量化模型预测值与真实值的差异,为训练提供“误差信号”(反向传播的起点)。

4. 优化器(Optimizer)功能​:根据损失函数的梯度更新模型参数(权重和偏置),最小化损失值。

反向传播

自动微分 ->反向传播

反向传播高效计算损失函数相对于神经网络权重的梯度

叶节点将是神经网络的权重 其他叶节点是数据本身 但通常我们不想要或使用损失函数相对于数据的导数 

反向传播最终目标:最小化损失函数

反向传播的任务就是从输出层“倒推”回输入层,找出每个“解题步骤”(参数)的“错误贡献”,然后调整这些步骤,让下次做题更准。

反向传播本质:遍历并递归的乘以局部导数

反向传播的步骤:1 前向传播 计算损失函数 2 计算总误差 3 反向推算计算梯度 这就是链式法则(Chain Rule)​​:将总误差 L从输出层开始,逐层反向传播,计算每一层的参数(W,b)对于总误差的“贡献”是多少,也就是梯度​(∂W∂L​, ∂b∂L​)

参数 W每微小变化一点,会对总误差 L造成多大的变化。它告诉我们参数调整的方向和幅度。

调整参数 梯度下降

 

 

更多推荐