logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

25 ICML Spotlight Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG

高分辨率(HR)图像感知一直是多模态大语言模型(MLLMs)中的一大挑战。为了解决现有方法的局限,本文摒弃了以往专门的启发式方案,而是回归HR感知的最基本思路——通过增强 MLLMs 的长上下文能力来提升 HR 感知,这一思路受到通用大语言模型在长上下文技术(如检索增强生成RAG)的最新进展的启发。为此,本文首次探索了将RAG应用于HR感知难题。具体而言,我们提出了检索增强感知(Perceptio

文章图片
#人工智能
RuntimeError: transform: failed to synchronize: cudaErrorAssert: device-side assert triggered

【代码】RuntimeError: transform: failed to synchronize: cudaErrorAssert: device-side assert triggered。

文章图片
#人工智能#大数据#数据库
AVG-LLAVA: A LARGE MULTIMODAL MODEL WITHADAPTIVE VISUAL GRANULARITY 2025 ACL

本文提出AVG-LLaVA模型,通过自适应视觉粒度选择机制优化高分辨率图像处理。该模型在LLaVA-NeXT基础上引入视觉粒度缩放器和路由器模块,能根据输入自动选择合适粒度,显著减少视觉token数量(如AI2D基准减少85.3%)并提升推理速度(最高2.53倍)。创新性地采用RGLF训练范式,通过LMM反馈对齐粒度选择偏好,无需人工标注。在11个基准测试中,AVG-LLaVA在保持性能优势的同时

#人工智能
RuntimeError: The size of tensor a (8) must match the size of tensor b (7) at non-singleton dimensio

在出现类似问题报错,并且该错误出现的情景为前面训练正常,在当前训练的epoch快要结束时出现报错,则该错误原因为在训练过程中所用的数据集数量与所设置的batchsize可能不是整除的关系,导致出错。

文章图片
#人工智能#python#深度学习
到底了