
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
MLLM轻量化论文阅读2
ROPE本身是给 q k 矩阵注入了绝对位置信息,用文本的q去查询每个vision token的 k,那么最后得出的注意力本身其实是不仅是文本对于vision token的注意力,还会掺杂着一些位置信息(这个我之前看过有大佬在写数学公式推导,但是的确没看太明白),所以把ROPE去掉,那么存在的就是文本引导下的注意力分布,规避了位置的影响。计算相同位置相邻帧的差值,给差值(可以理解成变化率)进行排序
到底了







