
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
解决现有多模态大语言模型的幻觉问题,突破传统RLHF依赖人工标注、现有RLAIF依赖专有模型的局限,通过全开源范式构建高质量反馈,实现模型可信度与人类偏好的对齐。核心创新去混淆响应生成:相同条件下多轮采样解码,消除文本风格干扰,凸显可信度真实差异;分而治之反馈标注:将响应拆解为原子声明,转换为极性问题评估,降低开源模型标注难度;迭代反馈学习:动态更新反馈分布,解决DPO训练中的分布偏移问题;推理自

qwen3vl将训练数据token又降低到2000B的规模(SFT阶段仅使用了120w数据),这表明训练数据量可能不是制约模型性能的关键,训练数据的分阶段配比利用才是多模态模型性能提升的关键。同时期InternVL3.5仅训练了1160M 样本(250B token,仅约InternVL1的1/5,约为qwen3vl的1/10)SFT阶段使用了600M(6亿条,是qwen3vl的500倍,但该阶段

数据层:搭建完整闭环数据管线,涵盖海量数据收集、过滤、人工标注、数据合成、样本均衡调配全流程;训练策略:采用渐进式课程学习训练训练递进顺序:无文本图像渲染 → 简单文字渲染 → 复杂文字渲染 → 段落级图文生成;价值:原生文字生成能力大幅提升;语言适配效果:英文字母类语言表现优异,对中文这类表意复杂文字渲染效果突破明显。

发表时间:2026.4.1论文地址:https://arxiv.org/html/2604.01193v1测试代码:https://github.com/apple/ml-ssd/tree/main。

self-attention来自nlp的研究中,在深度学习视觉领域有不少新的attention版本,为了解各种attention机制。博主汇集了6篇视觉领域中attention相关的论文,分别涉及DAnet(位置注意+通道注意)、CBAM(通道注意+空间注意)、Attention U-Net(注意Gate)、SAGAN(self-attention)、CCNet(交叉self-attention)

如做图像分类时,resnet系列、densenet系列、efficientnet系统、hrnet系列都可以测试一下。但是,并非所有的工作都能用到预训练模型,有的时候完全需要我们。
深度学习中常用的backbone有resnet系列(resnet的各种变体)、NAS网络系列(RegNet)、Mobilenet系列、Darknet系列、HRNet系列、Transformer系列和ConvNet。

是一款前沿、最先进(SOTA)的模型,基于先前 YOLO 版本的成功,引入了新功能和改进,进一步提升性能和灵活性。YOLOv8 设计快速、准确且易于使用,使其成为各种物体检测与跟踪、实例分割、图像分类和姿态估计任务的绝佳选择。随着其官方团队对ultralytics项目的不断完善,其所支持的功能在不断扩展,为此重新对ultralytics项目进行深入分析。

在深度学习中模型量化可以分为3块知识点,数据类型、常规模型量化与大模型量化。本文主要是对这3块知识点进行浅要的介绍。其中数据类型是模型量化的基本点。常规模型量化是指对普通小模型的量化实现,通常止步于int8的量化,绝大部分推理引擎都支持该能力。而大模型的量化,需要再cuda层次进行能力的扩展,需要特殊的框架支持。

项目地址:https://github.com/Pikapi22/SRModelCompression论文地址:https://arxiv.org/pdf/2401.00523发表时间:2024年2月21日深度学习技术已被应用于图像超分辨率(SR)领域,在重建性能方面取得了显著的进展。现有的技术通常采用高度复杂的模型结构,这将导致较大的模型规模和缓慢的推理速度。这往往导致高能耗,并限制了其在实际应








