
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要: 中山大学等机构联合提出首个高光谱遥感多模态大模型评测基准HM-Bench,填补了现有基准无法处理高光谱数据的空白。该基准覆盖20个公开数据集、13类任务,包含2178个样本块和19337条问答对,通过双模态(PCA合成图像+结构化文本报告)解决高光谱数据输入难题。实验评测18个主流模型发现,最佳模型准确率仅43.08%,光谱推理和变化检测是主要瓶颈,图像输入普遍优于文本输入。研究为高光谱多

摘要: 中山大学等机构联合提出首个高光谱遥感多模态大模型评测基准HM-Bench,填补了现有基准无法处理高光谱数据的空白。该基准覆盖20个公开数据集、13类任务,包含2178个样本块和19337条问答对,通过双模态(PCA合成图像+结构化文本报告)解决高光谱数据输入难题。实验评测18个主流模型发现,最佳模型准确率仅43.08%,光谱推理和变化检测是主要瓶颈,图像输入普遍优于文本输入。研究为高光谱多

摘要: 加州大学伯克利分校等机构提出的LIVR(Latent Implicit Visual Reasoning)框架,通过隐式视觉推理提升多模态大模型的视觉任务性能。该框架创新性地结合可学习潜在Token与视觉瓶颈注意力机制,无需显式监督即可自主提取关键视觉特征。潜在Token作为独立视觉表征空间,通过注意力掩码约束强制模型通过其传递视觉信息,弱化文本偏置。实验表明,LIVR在计数、拼图、空间定

本文系统综述了大语言模型(LLM)的高效压缩与调优方法。研究基于505篇文献的系统筛选,提出四大核心问题:压缩技术分类(RQ1)、调优方法趋势(RQ2)、实际应用场景(RQ3)及关键启示(RQ4)。研究构建了完整技术体系:压缩方法包括知识蒸馏(分预训练/白盒/黑盒三类)、低秩策略(近似与分解)、参数剪枝(结构化与非结构化)和量化(训练后与训练感知);调优技术涵盖参数高效微调(适配器/LoRA)、查

摘要: 加州大学伯克利分校等机构提出的LIVR(Latent Implicit Visual Reasoning)框架,通过隐式视觉推理提升多模态大模型的视觉任务性能。该框架创新性地结合可学习潜在Token与视觉瓶颈注意力机制,无需显式监督即可自主提取关键视觉特征。潜在Token作为独立视觉表征空间,通过注意力掩码约束强制模型通过其传递视觉信息,弱化文本偏置。实验表明,LIVR在计数、拼图、空间定

本文提出了一种多功能且可靠的遥感视觉语言模型VHM,通过构建大规模遥感图像-文本数据集VersaD(140万条)和首个遥感诚实性数据集HnstD(4.5万问答对),解决了现有模型通用性不足和易产生幻觉的问题。VHM采用两阶段训练策略,结合多尺度视觉特征融合,在遥感图像理解任务中实现了SOTA性能,同时能对无意义问题诚实回答"不知道"。实验表明,VHM在场景分类、目标检测等任务上表现优异,且显著提升

本文提出IRGPT模型,旨在解决真实场景红外图像理解中的关键挑战。通过构建大规模红外-文本数据集IR-TD(包含26万组真实图像-文本对),并提出双向跨模态课程迁移学习策略,实现了从可见光到红外领域的知识迁移。实验表明,IRGPT在9项基准任务中均达到最优性能,显著优于现有方法。该工作填补了红外图像多模态理解的空白,为相关领域提供了重要基准。

本文系统综述了大语言模型(LLM)的高效压缩与调优方法。研究基于505篇文献的系统筛选,提出四大核心问题:压缩技术分类(RQ1)、调优方法趋势(RQ2)、实际应用场景(RQ3)及关键启示(RQ4)。研究构建了完整技术体系:压缩方法包括知识蒸馏(分预训练/白盒/黑盒三类)、低秩策略(近似与分解)、参数剪枝(结构化与非结构化)和量化(训练后与训练感知);调优技术涵盖参数高效微调(适配器/LoRA)、查

摘要: 中山大学等机构联合提出首个高光谱遥感多模态大模型评测基准HM-Bench,填补了现有基准无法处理高光谱数据的空白。该基准覆盖20个公开数据集、13类任务,包含2178个样本块和19337条问答对,通过双模态(PCA合成图像+结构化文本报告)解决高光谱数据输入难题。实验评测18个主流模型发现,最佳模型准确率仅43.08%,光谱推理和变化检测是主要瓶颈,图像输入普遍优于文本输入。研究为高光谱多

本文提出了VSSD模型,通过非因果状态空间对偶性(NC-SSD)解决了传统SSM在视觉任务中的两大挑战:因果性限制和2D结构破坏问题。NC-SSD突破因果性瓶颈,使每个图像块对模型的贡献与其位置无关,保留全局感受野的同时维持线性复杂度。基于NC-SSD构建的VSSD模型在ImageNet分类等任务中表现优于CNN、ViT和现有SSM模型,实现了精度与效率的双重提升。方法创新包括:1)将SSD参数A








