logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大语言模型论文阅读—Title: GLM: General Language Model Pretraining with Autoregressive Blank Infilling

b. 创新,性能和工作负载:GLM与BERT、T5和GPT等现有的预训练框架相比,使用相同的模型尺寸和数据,在各种自然语言理解、条件和无条件生成任务中表现出卓越的性能。b. 历史发展:传统的语言模型使用从左到右的解码方式,而GLM的预训练目标则是训练模型预测句子中缺失的单词,从而能更好地预测未来输入的单词序列。a. 研究的理论基础:GLM使用自回归空格填充目标来预训练语言模型,通过变化不同长度和数

文章图片
#深度学习#人工智能#语言模型
大语言模型-RLHF(五)-PPO(Proximal Policy Optimization)原理&实现&代码逐行注释-论文导读

从open AI 的论文可以看到,大语言模型的优化,分下面三个步骤,SFT,RM,PPO,我们跟随大神的步伐,来学习一下这三个步骤和代码实现,本章介绍PPO论文。

文章图片
#人工智能#AIGC#神经网络 +2
深度学习Attention机制在短文本分类上的应用——qjzcy的博客

平常我们对分类的判断也是基于标题中的某些字,或者某些词性。比如《姚明篮球打的怎样》应该判别为体育,这时候“姚明”,“篮球”应该算对我们比较重要的词汇。词性我们关注点在“人名”和“名词”上面,深度学习的attention机制刚好符合这个特点。我们能不能利用attention机制来做分类呢,并且让注意力集中在我们期望的词上呢?先贴个结果,output是机器跑的分类结果,lable是人工打的分类结果。

#深度学习
大语言模型-RLHF(七)-PPO实践(Proximal Policy Optimization)原理&实现&代码逐行注释

这里涉及到两个问题,一个是如何扩展Context长度,一个是如何让llm模型只在指定Context内回答问题。今天我们ppo优化主要解决llm模型只在指定Context内回答问题。

文章图片
#人工智能#AIGC
深度学习的多gpu并行尝试——qjzcy的博客

深度学习的多gpu并行尝试——工作学习中的一点体会目录一、深度学习并行常用方法二、代码解析三、实验结果四、 一些细节(一)并行常用方法:一般有两种方法,一种是模型并行,另一种是数据并行。模型并行:由于bp网络的过程是个串行的过程,所以模型并行主要用在一个gpu的显存不能把所有的图结构都保存下来,于是我们把一个完整的网络切分成不同块放在不同gpu上执行,每个gp

#深度学习
深度学习Attention机制在短文本分类上的应用——qjzcy的博客

平常我们对分类的判断也是基于标题中的某些字,或者某些词性。比如《姚明篮球打的怎样》应该判别为体育,这时候“姚明”,“篮球”应该算对我们比较重要的词汇。词性我们关注点在“人名”和“名词”上面,深度学习的attention机制刚好符合这个特点。我们能不能利用attention机制来做分类呢,并且让注意力集中在我们期望的词上呢?先贴个结果,output是机器跑的分类结果,lable是人工打的分类结果。

#深度学习
深度学习Attention机制在短文本分类上的应用——qjzcy的博客

平常我们对分类的判断也是基于标题中的某些字,或者某些词性。比如《姚明篮球打的怎样》应该判别为体育,这时候“姚明”,“篮球”应该算对我们比较重要的词汇。词性我们关注点在“人名”和“名词”上面,深度学习的attention机制刚好符合这个特点。我们能不能利用attention机制来做分类呢,并且让注意力集中在我们期望的词上呢?先贴个结果,output是机器跑的分类结果,lable是人工打的分类结果。

#深度学习
大语言模型 RLHF(一)——ChatGLM代码逐行解读

为方便学习,对ChatGlm的代码做了逐行解读,这里主要是main方法,里面核心的部分如数据的解析,模型推理训练的框架流程。后续会针对ChatGLM核心优化代码做个解读,

文章图片
#开发语言#深度学习#机器学习 +2
vqvae简单实战,利用vqvae来提升模型向量表达

在cv里码本对应的encoder是卷积完的三维机构,如果我们是优化ID向量只有一维,需要做个转换把一维变成二维,这里可以用卷积,也可以把向量两两相乘变成二维结构,这样的好处是一方面方便我们把每一行当作一个向量和codebook求对应,另一方面两两相乘也可以理解为一种特征交叉,提升了向量的表达。在传统的 VAE 中,先验分布通常是一个固定的分布,例如标准正态分布。在VQ-VAE中,编码器将输入数据映

文章图片
#算法#人工智能#机器学习
深度学习Attention机制在短文本分类上的应用——qjzcy的博客

平常我们对分类的判断也是基于标题中的某些字,或者某些词性。比如《姚明篮球打的怎样》应该判别为体育,这时候“姚明”,“篮球”应该算对我们比较重要的词汇。词性我们关注点在“人名”和“名词”上面,深度学习的attention机制刚好符合这个特点。我们能不能利用attention机制来做分类呢,并且让注意力集中在我们期望的词上呢?先贴个结果,output是机器跑的分类结果,lable是人工打的分类结果。

#深度学习
    共 11 条
  • 1
  • 2
  • 请选择