logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

多模态大模型真的需要原生分辨率吗?

最近(2025年10月)发布的多模态大模型基本采用原生分辨率的图像配置,例如Kimi-VL、Qwen3-VL、Seed1.5-VL等。以Qwen3-VL为例,采用原生分辨率输入,保证输入图像的无损高清。然而,鲜有研究工作去分析图像分辨率、图像宽高比对多模态大模型的影响。北大、上海人工智能实验室等机构的研究人员构建评测集RC-Bench(Resolution-Centric)、原生分辨率多模态大模型

文章图片
#计算机视觉#人工智能#语言模型
多模态大语言模型arxiv论文略读(十八)

实验设计了不同的设置,如移除示例中的图像、替换为空白图像、移除查询图像等,以评估不同模态信息对ICL性能的影响。➡️ 实验设计:实验设计了多种攻击条件,包括不同的图像生成方法(如Stable Diffusion和Typography)、不同的攻击目标(如非法活动、仇恨言论、物理伤害等),以及不同的模型响应类型(如安全响应、恶意响应)。为了填补这一空白,研究团队设计了一种新的视觉提示攻击方法,旨在评

文章图片
#语言模型#人工智能#自然语言处理
多模态大语言模型arxiv论文略读(119)

➡️ 研究动机:为了定义和评估MLLMs在低级视觉感知和理解任务中的自我意识能力,研究团队提出了QL-Bench基准测试,通过构建LLSAVisionQA数据集来模拟人类对低级视觉的反应,探讨MLLMs在低级视觉感知中的自我意识。研究发现,MLLMs中的图像令牌存在明显的冗余,这不仅增加了计算负担,还影响了模型的效率。➡️ 问题背景:多模态大语言模型(MLLMs)在视觉感知和理解方面展现了显著的能

文章图片
#语言模型#人工智能#自然语言处理 +1
多模态大语言模型arxiv论文略读(二十)

最后,利用MLLMs的预测结果来优化视觉模型的参数,从而提高其在OOD任务中的鲁棒性。➡️ 研究动机:为了提高视觉模型在OOD场景下的鲁棒性,研究团队提出了一种新的方法——机器视觉疗法(Machine Vision Therapy, MVT),通过利用MLLMs的知识来纠正视觉模型的错误预测。➡️ 方法简介:研究团队提出了EtC(Expand then Clarify)方法,首先使用MLLMs生成

文章图片
#语言模型#人工智能#计算机视觉
多模态大语言模型arxiv论文略读(111)

➡️ 研究动机:为了弥补现有方法的不足,研究团队提出了一种新的框架CaRDiff(Caption, Rank, and generate with Diffusion),该框架通过整合多模态大语言模型(MLLM)、接地模块和扩散模型,增强了视频显著性预测的能力。为了解决这些局限性,研究团队提出了一种新的多模态代理框架,旨在适应动态的移动环境和多样化应用,通过构建灵活的动作空间和结构化的存储系统,增

文章图片
#语言模型#人工智能#自然语言处理 +1
多模态大语言模型arxiv论文略读(110)

实验设计了不同的因素(如面部表情标签的多样性、面部图像的裁剪等),以及不同类型的评估指标(如准确率、UAR、WAR等),以全面评估EMO-LLaMA在不同条件下的表现。➡️ 研究动机:为了增强MLLMs在面部表情理解方面的能力,研究团队提出了一种新的MLLM——EMO-LLaMA,通过结合预训练的面部分析网络中的面部先验知识,提高模型对人类面部信息的提取能力。➡️ 研究动机:研究团队发现,现有的M

文章图片
#语言模型#人工智能#自然语言处理 +1
多模态大语言模型arxiv论文略读(135)

本研究探讨了多模态大型语言模型(MLLMs)在推理过程中的计算冗余,并提出了不同的方法来跳过计算,如跳过整个块、前馈网络(FFN)或自注意力(SA)层,以及并行化某些层,如FFN和SA层。该框架包括冻结的LLM、可训练的映射模块(C)和冻结的感知编码器(EM),用于处理不同模态的输入。➡️ 研究动机:为了提高AEB系统在开放场景中的适应性,研究团队提出了Dual-AEB系统,该系统结合了先进的多模

文章图片
#语言模型#人工智能#自然语言处理
多模态大语言模型arxiv论文略读(109)

➡️ 研究动机:为了解决MLLMs在处理数学图表时的不足,研究团队提出了Math-PUMA,一种基于渐进式向上多模态对齐(Progressive Upward Multimodal Alignment, PUMA)的方法,旨在通过三个阶段的训练过程增强MLLMs的数学推理能力。然而,现有的MLLMs在心脏病诊断方面表现不佳,尤其是在ECG数据分析和长文本医疗报告生成的整合上,主要原因是ECG数据分

文章图片
#语言模型#人工智能#自然语言处理 +1
多模态大语言模型arxiv论文略读(七十二)

➡️ 论文标题:DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models➡️ 论文作者:Linli Yao, Lei Li, Shuhuai Ren, Lean Wang, Yuanxin Liu, Xu Sun, Lu Hou➡️ 研究机构: 北京大学、香港大学

文章图片
#语言模型#人工智能#自然语言处理
多模态大语言模型arxiv论文略读(156)

➡️ 方法简介:研究团队基于不同的预训练开源多模态大语言模型(MLLMs),如Qwen-VL、InternVL、Deepseek-VL,使用监督微调(SFT)、检索增强生成(RAG)和基于人类反馈的强化学习(RLHF)技术,将跨域知识注入MLLMs,从而构建多个小麦育种多模态大语言模型(WBLMs)。同时,小麦育种涉及生物学、遗传学、气象学和土壤科学等多个学科的交叉,专业人员在进行育种工作时需要跨

文章图片
#语言模型#人工智能#自然语言处理 +1
    共 98 条
  • 1
  • 2
  • 3
  • 10
  • 请选择