logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

NLP基础(注意力机制,多头注意力,层归一化,位置编码,掩码注意力)

和很多人想的不一样,注意力机制不是一诞生就取代了RNN,相反开始RNN和注意力机制是同时存在的。前面说过RNN的问题是,循环中会把信息反复压缩,这样距离远的token的占比会越来越低,表现为模型输出时忘记前面的内容,为了解决这个问题提出过LSTM,引入长期记忆,但是这个做法效果提升有限,太长了该忘还是忘,而且计算更复杂。

文章图片
#自然语言处理#rnn#人工智能
【CS336】lecture1 tokenization

语言模型处理的输入是字符串,但内部是对token预测概率,因此需要字符串到token的转换规则。也就是需要定义压缩率越高越好,因为压缩率高能把相同一段字符串输入,变成更短的token序列,降低模型训练推理的计算开销。然而压缩率提升往往需要更大的词典,比如把一个多个词组成的短语也看成一个token,而不是每个词一个token,压缩率自然提高了,但代价是词典里必须保存这个短语,不能只保存单个词汇。

文章图片
【CS336】lecture2 tensor|数据类型|einops库

最常见的就是fp32,如下图,每个占4B,32个bit,8bit存指数,23bit存有效数字,1bit存符号。数值范围和精度都比较可靠,问题是太消耗内存了,而AI不是科学计算,对精度要求没有那么高,牺牲性能换精度并不划算,所以fp32是最基础的类型,但不是追求极限性能场景使用的类型。我们具体分析一下,fp16的计算规则如下,S是符号位,E是指数位,M是尾数。eniops库的价值在于,shape推导

文章图片
#算法
【CS336】lecture2 FLOPs|MFU|计算强度|Roofline model|通算隐藏

这个通信不仅要发,还要接收相邻网格的数据,相邻网格和当前网格不在同一个线程块,或者不在一个GPU上,是异步计算的,中间有一段时间,通信处于阻塞。并且,这个线标志的是在特定计算强度下的上界,如果计算强度不变时,没达到这条线的上界,往往是因为前提没达到,也就是没有实现计算和通信的完美重叠,需要我们设计流水线来掩盖通信延迟。具体计算可以使用如下代码,注意这里我们算出来的是一个线性层的实际吞吐率,这既不是

文章图片
#性能优化
【CS336】lecture2 优化器|内存占用|计算量估计

对于模型中的某一层,前向传播最主要的计算量都在全连接层,全连接层计算是(B,D)的激活值,乘上(D,D)的全连接层矩阵,矩阵乘法每个位置都需要一次加法,一次乘法,总计算量大概为。具体实现上,速度或者说动量,采用历史梯度的指数移动平均,这样越近的梯度权重越大,越远的梯度影响越小,考虑了历史梯度信息,但不会使得很久以前的梯度一直叠加。激活值的B是batch size,D是隐藏层维度,也是每个token

文章图片
#人工智能#python#算法
【CS336】lecture3 RoPE|模型超参数|训练稳定性|注意力变体

最早的注意力架构,位置编码采用的是余弦编码,也就是加上一个三角函数,波长和token位置成正比。也有一些比较简单的模型如GPT3之前,使用绝对位置编码,第i个token就加上一个固定值,表示第i个。Llama使用了旋转位置编码,并且由于Llama是第一个性能能对齐闭源模型的开源模型,许多后来的开源和闭源模型都借鉴了它的设计,包括RoPE。一个好的位置编码应该具有相对位置的特性,也就是两个不同tok

文章图片
26杭电暑期第九场 贪心|bitset|分层图DP|线性基|笛卡尔树|KMP|随机哈希|博弈|随机游走|二位数点|分类讨论

贪心n个商品,如果一个商品价格超过当前钱的一半,则不会买。问至少准备多少钱,才能买下所有商品,并且商品购买顺序不确定。显然最贵的商品,最可能超过剩余钱的一半,导致买不了。并且如果所有商品价格一样,最后一个买的商品,前面已经花的钱最多,剩余钱最少,最可能超过钱的一半,导致买不了。综合一下,越贵,越靠后的越可能买不了。最严格的条件是:最贵的东西最后一个买,如果这个情况钱都够,前面的也都够。要满足这个条

文章图片
#哈希算法#分类#算法
NLP基础 GPT和BERT

但GPT-3模型是2020年发布的,到ChatGPT服务问世还过去了接近三年,这是因为此时的模型在指令遵循方面很差,类似于一个强大的野兽,不受人类控制。最终的测试效果,也证明了扩大参数规模的有效性,GPT-2不再像GPT-1一样需要对输入进行预处理,然后做微调,才能处理特定任务了,直接把在输入基础上用自然语言描述需要做的任务,就能在文本翻译,文本分类等特定任务上去的超过专用模型的效果,这就是所谓的

文章图片
#自然语言处理#bert
NLP基础 Llama(RMSNorm,SiLU,RoPE,GQA)

模型参数,基本没有增加,只有7B,13B,70B三个版本和前代差不多,但是训练数据增加了,从1T增加到2T,这正是Llama-1训练策略的延续数据量有更大的版本了,但仍然保持了小版本,分别有8B,70B,400B版本,对标GPT-4,相比Llama-2性能有了大的飞跃。这得益于训练数据从2T提升到了15T。

文章图片
#自然语言处理#人工智能
投机解码 Speculative Decoding 和 多token预测 MTP

投机解码是一种采样方式,先来看模型是如何采样的,模型的最后一层输出是一个长度等于词典大小的向量,表示下一个token是词典中每个词的概率。采样就是根据这个概率向量,选出来下一个token,也就是不会改变模型的推理架构。最简单的采样方式就是谈心采样,每一步都选向量中概率最大的token。也。

文章图片
    共 47 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择