logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大语言模型(LLM)

本文探讨了大语言模型(LLM)的创新架构与训练方法。首先介绍了LLM的三大训练阶段:预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)。重点分析了五种创新模型架构:1)混合专家模型(MoE)通过稀疏激活专家网络减少计算量;2)旋转位置编码(RoPE)改进位置信息表示;3)多头潜在注意力(MLA)压缩KV缓存降低内存消耗;4)Swish-GLU激活函数提升FFN性能;5)RMSNorm简

文章图片
#语言模型#人工智能#自然语言处理
深度学习入门(鱼书)摘抄

使用交叉熵误差作为Softmax函数的损失函数,反向传播后,softmax输出(y1-t1,y2-t2,y3-t3)这样“漂亮的结果”,是正向Softmax输出与监督标签的差分,可以直截了当的表示误差。如果高斯分布的标准差为1,各层的激活函数输出结果基本会偏向0和1分布,而这时的导数值逐渐接近于0,所以在反向传播中这些数据梯度的值会逐渐变小导致梯度消失。主要是为了调整输出的大小。这是因为在误差反向

文章图片
#深度学习#人工智能
大语言模型(LLM)

本文探讨了大语言模型(LLM)的创新架构与训练方法。首先介绍了LLM的三大训练阶段:预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)。重点分析了五种创新模型架构:1)混合专家模型(MoE)通过稀疏激活专家网络减少计算量;2)旋转位置编码(RoPE)改进位置信息表示;3)多头潜在注意力(MLA)压缩KV缓存降低内存消耗;4)Swish-GLU激活函数提升FFN性能;5)RMSNorm简

文章图片
#语言模型#人工智能#自然语言处理
Bert代码实战

文章摘要: 本文介绍了基于BERT的文本分类实现,包含三个核心部分:1) 数据处理模块使用PyTorch的Dataset和DataLoader构建训练/验证集,并采用sklearn的train_test_split进行数据划分;2) 模型部分继承BertModel,添加全连接层进行分类,详细说明了BERT输入构建方法及tokenizer参数;3) 训练流程展示了BERT模型前向传播过程,包括文本编

文章图片
#bert#人工智能#深度学习
典型图像分类卷积神经网络(CNN)的基本流程

本文介绍了卷积神经网络(CNN)的基本概念与结构。首先阐述了卷积核的作用,包括特征提取、参数共享和平移不变性。其次详细说明了卷积的输入输出维度计算,涉及填充(padding)和步长(stride)的应用。接着讨论了让特征图变小的两种方法:步长和池化(pooling)。然后描述了CNN图像分类的基本流程,从卷积到全连接层形成分类头。最后简要介绍了AlexNet、VGG13和ResNet等经典CNN模

文章图片
#cnn#分类#人工智能
大语言模型(LLM)

本文探讨了大语言模型(LLM)的创新架构与训练方法。首先介绍了LLM的三大训练阶段:预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)。重点分析了五种创新模型架构:1)混合专家模型(MoE)通过稀疏激活专家网络减少计算量;2)旋转位置编码(RoPE)改进位置信息表示;3)多头潜在注意力(MLA)压缩KV缓存降低内存消耗;4)Swish-GLU激活函数提升FFN性能;5)RMSNorm简

文章图片
#语言模型#人工智能#自然语言处理
Bert代码实战

文章摘要: 本文介绍了基于BERT的文本分类实现,包含三个核心部分:1) 数据处理模块使用PyTorch的Dataset和DataLoader构建训练/验证集,并采用sklearn的train_test_split进行数据划分;2) 模型部分继承BertModel,添加全连接层进行分类,详细说明了BERT输入构建方法及tokenizer参数;3) 训练流程展示了BERT模型前向传播过程,包括文本编

文章图片
#bert#人工智能#深度学习
到底了