
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
AI论文阅读(一)《Long Context Pre-Training with Lighthouse Attention》
可以再分别去看看相关的研究。设定一个池化因子p,往上每一层的窗口大小就是下面一层窗口大小*P,窗口不会重叠,窗口框住下面一层的元素,做平均池化,算平均值,作为这一层的窗口的Q、K、V(重新进行了计算,所以每个窗口框住的不管是原始序列的几个元素,算出来都是一个节点,一个QKV)。知道了原来多头注意力不是随便对矩阵做分块的,是直接训练多个W映射,将输入映射到多个低纬度的QKV,所以虽然是低纬度的QKV
到底了







