logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【CVPR26-陶大程-南洋理工】启发式推理先验助力数据高效型指代目标检测

不再让模型从稀缺数据中隐式学习基础推理规则,而是直接注入显式、可解释的启发式推理先验,引导模型快速收敛、提升数据效率。:显式建模“left/right/top/bottom/top-left”等方位约束,直接缩小目标搜索范围。,从候选筛选、预测输出到训练损失全链路引导,这是区别于所有后处理/简单融合方法的本质创新。将显式空间与语义启发式先验,深度注入DETR候选筛选、预测融合、训练匹配三大核心阶段

#目标检测#人工智能#计算机视觉
【CVPR26-纽约大学】PaQ-DETR:面向目标检测的模式与质量感知动态查询学习方法

DETR采用匈牙利一对一匹配,只有极少数查询能获得有效梯度更新,绝大多数查询处于“闲置”状态,基尼系数最高可达0.97,模型容量被严重浪费。,一举解决DETR查询失衡、监督稀疏的核心痛点,以极小计算开销实现1.5%~4.2%的稳定涨点,是即插即用、泛化性极强的DETR升级框架。一对一匹配仅为每个真实物体分配一个查询,监督信号不足,即便后续一对多方法,也采用固定正样本数,无法自适应筛选高质量监督样本

#目标检测#学习方法#目标跟踪 +2
【DeepSeek-OCR系列第二篇】CLIPPO:仅用像素就能理解图像与语言?【CVPR23】

数据(109 种语言的 10 亿图像-文本对)上训练模型, 并与 CLIP 及单塔(1T-CLIP)模型进行对比。多模态模型(如 CLIP、ALIGN)在图像-语言理解上取得了重大突破。: CLIPPO 让模型通过“看”来理解语言, 用统一的视觉方式,打通了多模态与多语言的界限。得分超过 CLIP 与 1T-CLIP, 与 ViLT、METER 等专用多模态模型相当。CLIPPO 用一个视觉模型“

【DeepSeek-OCR系列第四篇】PTP:让语言模型真正“读懂截图”的训练方法【arXiv24】

PTP 在相同上下文长度下将困惑度(Perplexity)从 10.28 降至 9.66,证明其可扩展至语言生成任务。这种联合训练方式让模型既“看清文字”,又能“读懂语言”。相比纯视觉自编码(如 PIXEL)或纯语言 MLM(如 BERT),PTP 在架构上更均衡。PTP 让语言模型学会“看文字、懂语义”, 是连接视觉与语言理解的关键一步,也让 Screenshot LM 真正具备语言智能。但问题

#语言模型#人工智能#深度学习 +1
【ICLR26匿名投稿】EAGLE:让多模态大模型“说清楚自己在看啥、靠啥写字”

相比基于梯度的可解释方法(如 IGOS++、Grad-CAM), EAGLE 显存占用减少约 70%~80%, 在 Qwen2.5-VL 7B 上运行仅需。这意味着即使模型答对了,我们也不知道它是“真懂”还是“瞎蒙”。给多模态大模型装上了“显微镜”, 让我们第一次能看清:每一个词,是看图得出的,还是靠想象写出来的。—— 不知道生成内容到底是“看图得出的”还是“语言模型自己编的”。: 找出“最少的一

【ICLR26匿名投稿】LENS 让多模态大模型拥有“像素级视力”

这一层负责将语言嵌入(Language Embedding)与空间坐标信息结合,使其输出与传统 segmentation decoder(如 Mask2Former、SAM-style head)兼容。此外,LENS 在跨任务与跨领域(如 open-vocabulary segmentation)中依旧表现稳定,展现出卓越的。一种即插即用(Plug-and-Play)的分割模块,使冻结的多模态模型

【南京大学-李文斌-arXiv25】超高分辨率遥感多模态大语言模型基准测试

很多问题不用看图像,纯文本模型靠常识就能答对——比如某基准中纯文本模型推理准确率达51.6%,甚至超过了多模态模型的45.2%,根本测不出真实视觉理解能力。RSHR-Bench填补了超高清遥感多模态模型评测的空白,用严格的设计和真实的场景,揭示了当前大模型的能力短板,为后续技术突破提供了可靠的“风向标”。:多数遥感基准用512×512或1024×1024的小图,与真实卫星/无人机拍摄的4K+超高清

#语言模型#人工智能#自然语言处理
【CVPR26-韩国科学技术院】令牌扭曲技术助力多模态大语言模型从邻近视角观察场景

即便融入3D感知特征、显式3D监督,模型也难以完成可靠的视角转换推理,无法像人类一样从邻近新视角理解场景结构。反向令牌扭曲以图像令牌为单元替代像素扭曲,让多模态大模型无需生成新图像,就能轻量、鲁棒地完成邻近视角的场景推理,全面优于传统方法。:在目标视角构建密集规则网格,反向映射至源图检索令牌,避免正向扭曲的稀疏空洞问题;:用ViT架构的图像令牌替代像素,令牌兼具细节与鲁棒性,可抵抗几何噪声;:推理

#语言模型#人工智能#自然语言处理
【ECCV24】【红外目标检测】IRSAM

论文:https://arxiv.org/abs/2407.07520代码:https://github.com/IPIC-Lab/IRSAM点评这篇文章将SAM用于红外图像目标的识别。核心创新点是引入边缘和多尺度信息,但其实也是很常见的了。边缘的提取借鉴的Perona-Malik理论。摘要最近的“任意分割模型”(SAM)是自然图像分割领域的一项重大进步,具有强大的零样本性能,适用于各种下游图像分

#目标检测#人工智能#计算机视觉
【清华大学-MM25】Open3D VQA:面向无人机开放空间的多模态大语言模型空间推理基准

Open3D-VQA基准首次构建了空中视角下的三维空间推理评测体系,既揭示了当前AI在距离测算、视角转换等任务中的短板,也为无人机导航、城市智能分析等领域的技术优化提供了关键支撑。模拟数据微调效果显著:仅用模拟场景数据微调后,LLaVA和Qwen2-VL在真实场景中的推理准确率分别提升6.5%和22.3%,验证了数据的泛化价值。多维任务设计:涵盖4种空间视角(如上帝视角、第一人称视角)和7类推理任

#无人机#语言模型#人工智能 +1
    共 96 条
  • 1
  • 2
  • 3
  • 10
  • 请选择