
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
最近多模态相关的论文好火,原因就不多说了(懂得都懂),因为有不少想发paper的同学来问了,我就火速整理了一部分来和你们分享。这次整理了,还有,主要涉及预训练、表征学习、多模态融合等热门细分方向,论文包大家可以看文末领取!

推荐一个交叉方向:小波变换+注意力机制。近年来它潜力很大,不仅在理论上巧妙地融合了两种机制的优点,在实践中也展现出了卓越的性能。目前它核心的创新方向主要有三大类:架构创新、应用创新、理论深化。在最近的顶会顶刊均有成果产出,尤其架构创新这类。比如AAAI25的具有全新结构逻辑的多频率融合注意力模块MFFA,以及双一区的三位一体化融合架构Stockformer,用于股票选择。推荐想快速上手的同学尝试。

从今年ICML等顶会的录用情况来看,多模态融合+迁移学习这个组合持续火爆。TPAMI上也有不少成果。而在工业界方面,谷歌、微软等巨头的动态也展示了这方向清晰的商业化路径。可以看出,多模态融合+迁移学习是个相当不错的研究方向。目前比较常见的思路还是参数微调、数据迁移、具体问题改进等,如果大家想发文,也可以尝试边缘设备、生成式迁移等切入点。为了方便大家快速定位自己的研究,我整理了17篇多模态融合+迁移

通过优化ViT结构和训练策略,我们可以提高模型的性能和计算效率,增强模型对局部信息的捕捉能力。同时解决一些原有模型存在的问题。比如原始的ViT模型在处理高分辨率图像时,由于自注意力机制的计算复杂度与序列长度相关,会导致较高的计算成本。通过对ViT进行改进,我们就可以减少参数量和计算量。这类改进不仅能够更高效地处理图像数据,同时还能增强ViT在各种视觉任务中的适用性。因此,为了让模型更加高效和适用于

李沐大神前阵子在上交大的演讲大家关注了没,听完确实认同多模态才是当下的一个趋势。特别是为了应对任务复杂性、数据标注难题等方面的需求,当前我们对的研究热情已经空前高涨。它可以通过同时处理多种类型的数据,全面提高模型的表征、泛化等各项能力,也不需要我们大量标注数据,因此最近这方向一些阶段性的结果已经在各大顶会发表了,比如CVPR 2024的ULIP-2框架,无需标注数据即可刷新SOTA;还有AAAI

在高度城市化地区实施先进智能交通系统的挑战之一是全球导航卫星系统(GNSS)接收机定位精度不足。多径Multipath和非视线(NLOS)效应严重恶化了GNSS定位性能。本文旨在通过有监督机器学习训练分类器,将GNSS伪距测量分为三类:clean, multipath and NLOS。从全球导航卫星系统原始数据中获得或计算出的若干特征进行了评估。本文还提出了一种新的特征来表示伪距测量值和多普勒频

如何让模型既能“辨别差异”,又能“汲取精华”?这就不得不提“对比学习+知识蒸馏”这组合了,能有效解决单一技术的局限性,协同效应up!这方向在资源受限的场景下大有可为,而这类应用场景正不断扩展,可以说为创新提供了丰富土壤。从最近发布的成果来看,这组合解决实际问题的能力相当强,比如IEEE TII的CoUDA框架,在动态工作条件下实现了SOTA。目前这方向发论文的机会不错,顶会顶刊都对这类交叉研究挺青

注意力机制因为其核心地位和持续出现的性能瓶颈,如今还在不断提供新的创新机会。也正因如此,当前的创新主要集中在让注意力机制更高效、更强大,或者更“聪明”。简单总结下来有四大类:结构设计与尺度、特征处理与融合、模型架构与组合、特定任务或领域。鉴于这方向对创新的质量要求也越来越高,推荐想发论文的同学了解前沿后再下手。本文根据以上分类整理了183篇注意力机制前沿论文,帮大家省去了查找资料的时间。其中包含注

可以在保持网络深度的同时,提高模型对任务相关特征的识别和利用能力,以及对关键信息的捕捉能力。具体来说,结合的方式通常是在RetNet的基础上添加注意力模块。这些模块(自注意力机制/通道注意力机制)通过对特征图进行分析,为不同的特征或特征通道分配不同的权重,从而突出重要的信息并抑制不重要的信息。这种结合策略。因此,RetNet结合注意力机制已经成为深度学习领域的一个研究热点。本文整理了,每种方案可参

近来注意力机制顶刊顶会论文高度聚焦于三大方向:一是注意力机制的效率优化,这是最活跃的方向,核心是解决标准Transformer中自注意力计算的二次复杂度带来的计算和内存瓶颈,让其能处理更长序列或部署在资源受限的设备上;二是注意力机制的认知与能力边界探索,旨在理解和突破注意力模型的能力极限,探索其在认知和学习方面的可能性;三是注意力基础架构的创新与挑战,这方向不再对现有Transformer搞些小修








