
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在该文件中存在所有涉及模型的超参。
之前阅读后忘记记录笔记,稍微记录一下一些重要的如上图左所示,FCOS回归的一个四维向量ltrb,即样本点到gt box的四个距离,值得注意的是回归目标都为正样本吗,所以在reg head的部分使用了expx将这四个量映射到了第一象限。右图展示了如果一个样本点同时落在多个gt box之中可能会存在一定的模糊,该样本点回归的边界框可能不明确,后续也专门介绍了解决此类问题的方法。

本文介绍了Qwen2-VL及家族模型的技术特点与架构设计。该系列采用"视觉编码器→跨模态连接器→LLM"的通用框架,通过2D旋转位置编码(2D RoPE)和多模态旋转位置编码(MRoPE)增强视觉位置信息建模能力,支持动态分辨率处理。模型包含2B、7B和72B三种规模,采用三阶段训练策略:预训练阶段使用1.4万亿词元数据,指令微调阶段引入多模态对话和视觉定位任务。关键技术包括朴

Qwen-VL是一种视觉语言模型,采用Qwen-7B作为基础大语言模型,结合ViT视觉编码器和创新的位置感知视觉-语言适配器。模型通过三阶段训练:先使用图像-文本对预训练视觉组件,再通过多任务预训练提升分辨率至448×448并解冻LLM,最后进行监督微调增强对话能力。数据处理上,使用特殊标记区分图像和边界框输入,并采用归一化坐标表示。训练注重损失计算策略,仅监督关键文本部分,最终采用贪婪搜索解码。

Qwen3-VL多模态模型技术报告摘要 Qwen3-VL是新一代视觉语言大模型,包含密集型(2B-32B)和混合专家型(30B-238B)两种架构。主要创新包括:1)改进的交错式MRoPE位置编码,增强时空建模能力;2)DeepStack多级视觉特征集成,强化模态对齐;3)文本时间戳显式对齐机制,提升时序感知。模型采用四阶段渐进式训练策略,从视觉文本对齐到256K超长上下文适应。数据方面通过重描述

patch_size的增加有助于减少token数量,降低计算量,缺点是更容易丢失局部信息。

Qwen3-VL多模态模型技术报告摘要 Qwen3-VL是新一代视觉语言大模型,包含密集型(2B-32B)和混合专家型(30B-238B)两种架构。主要创新包括:1)改进的交错式MRoPE位置编码,增强时空建模能力;2)DeepStack多级视觉特征集成,强化模态对齐;3)文本时间戳显式对齐机制,提升时序感知。模型采用四阶段渐进式训练策略,从视觉文本对齐到256K超长上下文适应。数据方面通过重描述

本文介绍了Qwen2-VL及家族模型的技术特点与架构设计。该系列采用"视觉编码器→跨模态连接器→LLM"的通用框架,通过2D旋转位置编码(2D RoPE)和多模态旋转位置编码(MRoPE)增强视觉位置信息建模能力,支持动态分辨率处理。模型包含2B、7B和72B三种规模,采用三阶段训练策略:预训练阶段使用1.4万亿词元数据,指令微调阶段引入多模态对话和视觉定位任务。关键技术包括朴

本文提出了一种多模态大模型架构及训练方案。模型采用Qwen2.5 LLM处理文本,结合ViT视觉编码器,通过改进的RoPE机制实现多模态时间对齐。训练分为三个阶段:视觉预训练、多模态预训练和长序列训练。微调采用监督学习(SFT)和直接偏好优化(DPO)两阶段策略,其中视觉参数保持冻结。数据清洗采用双阶段流程,结合领域分类和过滤规则,并通过Rejection Sampling筛选高质量推理样本。该方

之前阅读后忘记记录笔记,稍微记录一下一些重要的如上图左所示,FCOS回归的一个四维向量ltrb,即样本点到gt box的四个距离,值得注意的是回归目标都为正样本吗,所以在reg head的部分使用了expx将这四个量映射到了第一象限。右图展示了如果一个样本点同时落在多个gt box之中可能会存在一定的模糊,该样本点回归的边界框可能不明确,后续也专门介绍了解决此类问题的方法。








