一些用于捋清思路的深度学习基础知识
深度学习模型分类
1. 分类模型(Classification)
典型模型:
CNN:LeNet(手写数字分类)、ResNet(ImageNet图像分类)。
Transformer:BERT(文本分类)、ViT(图像分类)。
2.回归模型(Regression)
目标:预测连续数值(如房价、温度、销量)。
典型模型:
线性回归(传统ML,但可视为浅层神经网络)。
MLP(多层感知机):全连接层组成的神经网络(如预测用户评分)。
CNN/LSTM:结合结构特征(如图像中的房屋面积、文本中的时间序列)。
3. 生成模型(Generation)
目标:生成与训练数据分布一致的新数据(如图像、文本、音频)。
典型模型:
GAN(生成对抗网络)(2014):通过生成器(Generator)与判别器(Discriminator)博弈,生成高保真图像(如StyleGAN生成人脸)。
VAE(变分自编码器)(2013):通过概率建模生成数据(如生成手写数字)。
扩散模型(Diffusion Models)(2020):通过逐步添加噪声再去噪的方式生成高质量图像(如Stable Diffusion、DALL·E 2)。
Transformer生成模型:GPT(文本生成)、MusicGen(音乐生成)。
4. 序列建模(Sequence Modeling)
5. 检测与分割模型(Detection & Segmentation)
深度学习框架:PyTorch(动态图)、TensorFlow(静态图)、JAX(自动微分+JIT编译)等 框架支撑模型,模型依赖框架
深度学习典型模型:
卷积神经网络(CNN,图像)(ResNet等)、
循环神经网络(RNN,序列)、
Transformer(自然语言处理、多模态)(有bert gpt系列等)。
神经网络
一、神经元(Neuron):神经网络的基本单元
二、层(Layer):神经网络的层级结构
1. 输入层(Input Layer)功能:接收原始输入数据(如图像像素、文本词向量),并将其传递给下一层。
2. 隐藏层(Hidden Layer)功能:通过神经元的连接和非线性变换,从输入数据中提取抽象特征(如图像的边缘、纹理,文本的语义)。
3. 输出层(Output Layer)功能:将隐藏层的特征映射到目标任务的空间(如分类任务的类别概率、回归任务的连续值)。
三、核心层类型:按功能划分的关键模块
1. 全连接层(Fully Connected Layer, FC Layer)结构:每个神经元与前一层所有神经元全连接(权重矩阵 W∈R
n×m,n为前一层神经元数,m为当前层神经元数)。
2. 卷积层(Convolutional Layer, Conv Layer)结构:通过卷积核(Filter)在输入数据上滑动,提取局部空间特征(如图像的边缘、纹理)。
3. 循环层(Recurrent Layer, RNN Layer)结构:通过隐藏状态(Hidden State)传递序列信息,捕捉时间或顺序依赖(如文本中的上下文关系)。
4. 注意力层(Attention Layer)结构:通过注意力机制(Attention)动态计算输入序列中各元素的重要性权重,聚焦关键信息。
5. 池化层(Pooling Layer)结构:通过下采样(Downsampling)降低特征图的空间尺寸(如高度、宽度),减少计算量并增强平移不变性。
四、辅助模块:提升模型性能的关键组件
1. 激活函数(Activation Function)功能:对神经元的线性输出进行非线性变换,引入“非线性能力”,使网络能学习复杂模式(如分段函数、指数关系)。
2. 正则化模块(Regularization)功能:防止模型过拟合(在训练数据上表现好,但在新数据上泛化差),提升模型泛化能力。
3. 损失函数(Loss Function)功能:量化模型预测值与真实值的差异,为训练提供“误差信号”(反向传播的起点)。
4. 优化器(Optimizer)功能:根据损失函数的梯度更新模型参数(权重和偏置),最小化损失值。
反向传播
自动微分 ->反向传播
反向传播高效计算损失函数相对于神经网络权重的梯度
叶节点将是神经网络的权重 其他叶节点是数据本身 但通常我们不想要或使用损失函数相对于数据的导数
反向传播最终目标:最小化损失函数
反向传播的任务就是从输出层“倒推”回输入层,找出每个“解题步骤”(参数)的“错误贡献”,然后调整这些步骤,让下次做题更准。
反向传播本质:遍历并递归的乘以局部导数
反向传播的步骤:1 前向传播 计算损失函数 2 计算总误差 3 反向推算计算梯度 这就是链式法则(Chain Rule):将总误差 L从输出层开始,逐层反向传播,计算每一层的参数(W,b)对于总误差的“贡献”是多少,也就是梯度(∂W∂L, ∂b∂L)
参数 W每微小变化一点,会对总误差 L造成多大的变化。它告诉我们参数调整的方向和幅度。
调整参数 梯度下降
更多推荐
所有评论(0)