logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Vision Transformer原理及代码学习【新芽第四周】

对于RNN,通过前一时间步的隐藏状态和历次输入的共同作用来得到输出,对于简单的文本序列比较友好,由于参数量少,其推理速度快,但是面对长文本序列时,如针对大篇幅的文章摘要,开头关键词的重要性会随着文章段落的增长而逐渐被稀释。其实简单来讲,有点类似于分组卷积,本质就是将参数矩阵给拆分成head数量,分别组成不同组的V、K和Q来各自做self-attention,最后合并后和一个可训练的参数。,需要注意

文章图片
#transformer#学习#深度学习 +2
到底了