logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

特征金字塔+自注意力封神!NeurIPS发文利器,必须学!

本文介绍了两项基于特征金字塔网络(FPN)改进的目标检测与分割研究。第一项针对手术场景分割,提出时序非对称特征金字塔(TAFPNet),通过双向注意力机制和时序查询传播器解决器械快速移动问题。第二项针对航拍小目标检测,提出跨层特征金字塔Transformer(CFPT),采用跨层注意力交互避免特征丢失。两项研究均通过特定场景下的结构创新,在保持计算效率的同时显著提升性能。研究突出了FPN改进的关键

文章图片
#深度学习#人工智能
TDNet:双向LSTM门控三解码器网络用于遥感变化检贝

【摘要】本文提出TDNet,一种用于遥感变化检测的新型网络架构,针对传统孪生编码器-单解码器结构存在的多尺度特征交互不足问题,创新性地设计了双向LSTM门控交互模块(BLMIM)和三重解码器结构。通过LSTM门控机制实现跨尺度特征的双向信息传递,结合级联式三重解码器逐步精炼特征,显著提升了变化检测精度。在LEVIR-CD、CDD和WHU-CD三个基准数据集上的实验表明,TDNet相比现有方法F1分

文章图片
#人工智能
AI科研写作新突破:谷歌提出PaperOrchestra,AI智能体天团协作,从草稿到LaTeX一键搞定,模拟顶会接收率84%!

本文提出神经分布先验(NDP)框架,解决LiDAR感知中类别不平衡导致的OOD检测难题。通过可学习的注意力模块动态校准OOD分数,结合Perlin噪声合成OOD样本和软性离群点暴露训练策略,在STU数据集上AP提升超10倍。核心创新在于利用神经网络学习预测分布结构,自适应调整置信度偏差,显著提升自动驾驶场景对未知物体的识别能力。

文章图片
#人工智能#计算机视觉#深度学习
ArXiv 26 S2M框架:从掩码中提取结构化文本,实现零成本多模态遥感变化检测

本文提出了一种新颖的遥感变化检测方法S2M,通过从现有掩码标签中自动提取结构化文本信息(位置、类别、类型、数量),实现零成本的多模态监督。该方法采用两阶段训练策略,结合视觉骨干网络和文本引导对齐模块,有效解决了语义模糊性问题。实验表明,S2M在多个数据集上显著优于基线模型,特别是减少了微小目标的漏检。该方法的创新点在于挖掘现有数据的隐含价值,无需额外标注或大模型支持,为资源受限场景提供了高效解决方

文章图片
#人工智能#算法#计算机视觉
港中深新作:MPerS架构:融合DINOv3与动态混合专家MLLM,实现遥感分割新SOTA

本文提出了一种创新的遥感图像语义分割方法,通过多模态大语言模型生成高质量文本描述来提升分割精度。研究团队设计了动态混合专家文本编码器(DMTE),利用三种不同视角的提示词引导多个MLLM生成多样化描述,并通过门控机制自适应筛选最优文本特征。结合语言查询引导注意力(LQGA)模块,该方法实现了文本语义对视觉特征的有效引导。实验表明,在多个遥感数据集上,该模型在mIoU和mF1指标上均显著优于现有方法

文章图片
#人工智能#计算机视觉
AI科研写作新突破:谷歌提出PaperOrchestra,AI智能体天团协作,从草稿到LaTeX一键搞定,模拟顶会接收率84%!

本文提出神经分布先验(NDP)框架,解决LiDAR感知中类别不平衡导致的OOD检测难题。通过可学习的注意力模块动态校准OOD分数,结合Perlin噪声合成OOD样本和软性离群点暴露训练策略,在STU数据集上AP提升超10倍。核心创新在于利用神经网络学习预测分布结构,自适应调整置信度偏差,显著提升自动驾驶场景对未知物体的识别能力。

文章图片
#人工智能#计算机视觉#深度学习
正在爆发!视频扩散模型成论文新赛道,2026发文必冲!

摘要:视频扩散模型因Sora的发布引发广泛关注,但其技术门槛显著高于图像生成。核心挑战在于时序一致性(如帧间连贯性)和计算复杂度(如长视频的显存需求)。当前研究聚焦三大方向:1)时序建模(3DU-Net、时空注意力机制);2)高效采样(DiT架构替代传统U-Net);3)可控生成(文本/动作序列等条件输入)。最新突破包括清华VideoScene框架通过3D感知蒸馏实现单步3D场景生成,以及综述研究

文章图片
#音视频#人工智能#深度学习 +1
时序注意力 + 跨帧对齐重磅突破!荣登Nature顶级子刊!

视频理解技术进展与多模态情感分析新方法 近期视频理解领域聚焦时序注意力与跨帧对齐技术,相比传统3D卷积,注意力机制在长视频建模中更具优势。当前研究趋势包括分解式时空注意力、对齐引导注意力和隐式可学习对齐(如NeurIPS 2022的ATA、ICCV 2023的ILA),以解决计算复杂度和运动对齐问题。 在多模态情感分析方向,KAIST提出多模态自注意力网络(MULTIMODAL SELF-ATTE

文章图片
#计算机视觉#人工智能
时序注意力 + 跨帧对齐重磅突破!荣登Nature顶级子刊!

视频理解技术进展与多模态情感分析新方法 近期视频理解领域聚焦时序注意力与跨帧对齐技术,相比传统3D卷积,注意力机制在长视频建模中更具优势。当前研究趋势包括分解式时空注意力、对齐引导注意力和隐式可学习对齐(如NeurIPS 2022的ATA、ICCV 2023的ILA),以解决计算复杂度和运动对齐问题。 在多模态情感分析方向,KAIST提出多模态自注意力网络(MULTIMODAL SELF-ATTE

文章图片
#计算机视觉#人工智能
掌握小波变换+CNN,发中科院二区及以上不是问题!

近期的计算机视觉研究越来越关注如何突破传统卷积网络在空间域处理的局限性。本次解析的两篇论文共同探索了将信息,特别是**小波变换 (Wavelet Transform)**,融入深度学习模型以解决不同挑战。第一篇论文《MLWNet》聚焦于任务,针对现有模型在处理真实运动模糊时的复杂性和细节恢复不足问题,提出了一种高效的架构,并首创性地设计了**可学习离散小波变换 (Learnable DWT)**模

文章图片
#人工智能#计算机视觉
    共 47 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择