logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【第四十二周】论文阅读

本周开始第二个评估实验,由于数据量较大,运行时间较长,运行间隙阅读了论文《When Tokens Talk Too Much: A Survey of Multimodal Long‑Context Token Compression across Images, Videos, and Audios》,论文是第一个系统性地对多模态长上下文 token 压缩领域进行梳理的综述。多模态大语言模型(M

#论文阅读#学习
【第四十九周】论文阅读

本周研读论文《DOCPRUNE: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning》。该论文针对文档问答任务 Token 冗余、算力开销大的问题,提出无训练渐进式 Token 剪枝框架 DOCPRUNE。框架包含 BTP、QTP、CTP 三大模块

#论文阅读
【第四十八周】论文阅读

本周针对多模态大模型中视觉 Token 剪枝在复杂视觉推理任务上失效的问题展开研究。研究发现 ** 相关视觉信息偏移 (RVIS)** 是该问题的核心成因,并提出无需训练、可即插即用的 DSTP 框架。该框架通过偏移检测与上下文感知 Token 交换两大模块,在解码阶段动态调整视觉 Token,有效适配推理过程中变化的视觉信息需求。大量实验证明,DSTP 能显著修复剪枝带来的性能损失,在各类任务与

#论文阅读
【第四十六周】问题记录+论文阅读

本周主要解决项目运行中出现的问题,并且阅读论文《UniCompress: Token Compression for Unified Vision–Language Understanding and Generation》,论文中提出UniCompress插件式压缩框架,通过全局元 token 引导压缩与解压缩,无需全量重训即可集成,实现4 倍 token 压缩。统一多模态模型通过将图像编码为离

【第四十五周】论文阅读

本周主要阅读论文《When Tokens Talk Too Much: A Survey of Multimodal Long-Context Token Compression across Images, Videos, and Audios》,这篇综述系统梳理了多模态大语言模型中的长上下文令牌压缩技术。针对图像、视频、音频三种模态,文章分析了各自特有的冗余特征(空间、时空、时频),并按照变换

#论文阅读
【第四十四周】论文阅读

本周主要阅读了《Text-Guided Visual Token Selection for Large Multimodal Models》论文,FlashVLM通过文本引导融合视觉显著性与跨模态相似度,动态选择关键视觉令牌,在超75%压缩下性能不降反升,显著提升多模态模型效率。FlashVLM优点简单有效:不需要修改模型内部,插拔式使用。超越无损:适当剪枝反而能提升性能(去噪声效应)。高度通用

#论文阅读
【第四十二周】论文阅读

本周开始第二个评估实验,由于数据量较大,运行时间较长,运行间隙阅读了论文《When Tokens Talk Too Much: A Survey of Multimodal Long‑Context Token Compression across Images, Videos, and Audios》,论文是第一个系统性地对多模态长上下文 token 压缩领域进行梳理的综述。多模态大语言模型(M

#论文阅读#学习
【第四十一周】论文复现记录04

本周在进行评估模型的实验,同时阅读了论文《Compress and Cache:Vision Token Compression for Efficient Generation and Retrieval》第一遍:LLM 将密集视觉 token 压缩为少量“摘要 token”。第二遍:使用摘要 token 替代原始图像 token 进行语言指令处理。(引入 对比损失 提升摘要 token 的判别

#学习#论文阅读
【第三十五周】论文阅读01

本周主要精读两篇文献。《Learning Transferable Visual Models From Natural Language Supervision》主要讲述CLIP模型,该模型通过对比学习进行预训练,完成后可以进行零样本迁移,并且模型表现良好。同时考虑到输入数据为图文对,有的文本存在多重含义,因此具体化提示词,增加匹配准确性。

#论文阅读
【第四十周】论文复现记录03

本周主要完成了论文模型的复现,对过程中遇到的问题进行记录。同时对论文《Token Sequence Compression for Efficient Multimodal Computing》第二种方法进行进行补充学习。1,更换镜像**核心作用:**给当前云服务器重装 / 更换操作系统,相当于给电脑换系统。原来的系统用腻了 / 出问题了,想从 CentOS 换成 Ubuntu,或从 Window

#学习
    共 16 条
  • 1
  • 2
  • 请选择