logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

MLLM轻量化论文阅读2

ROPE本身是给 q k 矩阵注入了绝对位置信息,用文本的q去查询每个vision token的 k,那么最后得出的注意力本身其实是不仅是文本对于vision token的注意力,还会掺杂着一些位置信息(这个我之前看过有大佬在写数学公式推导,但是的确没看太明白),所以把ROPE去掉,那么存在的就是文本引导下的注意力分布,规避了位置的影响。计算相同位置相邻帧的差值,给差值(可以理解成变化率)进行排序

#人工智能#深度学习#论文阅读
到底了