logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

模型剪枝中有哪些经验|mobile-yolov5-pruning-distillation项目中剪枝知识分析

mobile-yolov5-pruning-distillation是一个以yolov5改进为主的开源项目,主要包含3中改进方向:更改backbone、模型剪枝、知识蒸馏。这里主要研究其模型剪枝部分,关于知识蒸馏后续在进行分析。关于更改非coco训出的backbone(使用moblienet替换),可以发现存在相助的精度下降,这表明imagenet域训练处的权重迁移到目标检测领域不如二次迁移的模型

文章图片
#剪枝#算法
实现目标检测中的数据格式自由(labelme json、voc、coco、yolo格式的相互转换)

在进行目标检测任务中,存在labelme json、voc、coco、yolo等格式。labelme json是由anylabeling、labelme等软件生成的标注格式、voc是通用目标检测框(mmdetection、paddledetection)所支持的格式,coco是通用目标检测框(mmdetection、paddledetection)所支持的格式,yolo格式是yolo系列项目中所支

文章图片
#目标检测#json
C++ ubuntu环境下安装编译部署环境,用onnxruntime部署ppyoloe_r模型

在新安装的ubuntu环境下修改源、安装gcc和cmake,编译安装opencv,安装onnxruntime环境。并编写cmakelist文件,编译与运行ppyoloe_r模型。windows环境下onnx部署ppyoloe_r模型的代码可以参考https://blog.csdn.net/a486259/article/details/128151738,这里基于该代码进行linux适配,最终成功

文章图片
#ubuntu#c++#linux
win10下cuda12.1 +troch2.4.1+vs2022环境下编译安装flash-attn

win10下cuda12.1 +troch2.4.1+vs2022+python3.8环境下编译的flash-attn库,同时有编译好的whl文件的下载地址

文章图片
#python#深度学习
EISeg——应用于语义分割的自动标注软件

1、介绍EISeg(Efficient Interactive Segmentation)是以RITM及EdgeFlow算法为基础,基于飞桨开发的一个高效智能的交互式分割标注软件。涵盖了通用、人像、遥感、医疗等不同方向的高质量交互式分割模型,方便开发者快速实现语义及实例标签的标注,降低标注成本。 另外,将EISeg获取到的标注应用到PaddleSeg提供的其他分割模型进行训练,便可得到定制化场景的

文章图片
#深度学习
wan2.1 论文精读三 | 下游应用

​本博文一共介绍了wan2.1模型在图生视频(含首尾帧、视频续写)、视频编辑(VACE架构)、文生图、个性化视频(参考id生成视频,类vace架构)、摄像机运动控制、实时视频生成(世界模型)、音频生成领域的应用。关于图生视频领域,主要基于时序条件图像编码、mask控制。具体是将条件图像 I与沿时间轴填充零的帧连接起来,这些引导帧通过 Wan- VAE 压缩为条件潜在 zc,最终chanel为c;引

文章图片
#论文阅读#AIGC#深度学习
从大模型中的chat_template了解jinja模板语法

基于macro 与 endmacro 闭合函数定义域;render_content为函数名。

#python#深度学习
InternVL(1~3.5版本)多模型大模型训练中的数据集构造总结

InternVL基于互联网开源数据采集了6B数据,经过滤后一阶段用了5B数据,二阶段用了1B数据。SFT阶段,用了4M数据(二阶段的0.4%)。InternVL1.5与上一版本相比,扩大了训练数据集的纳入范围(尤其是关于ORC任务,进行了细粒度的划分),并且设计了补充中文语料训练数据的不足,同时针对测试任务针对性设计了SFT数据。InternVL2基于1.5版本的数据集,二次进行扩充,同时构建了的

文章图片
#人工智能
QwenVL(2、2.5、3版本)多模型大模型训练中的数据集构造总结

qwen3vl将训练数据token又降低到2000B的规模(SFT阶段仅使用了120w数据),这表明训练数据量可能不是制约模型性能的关键,训练数据的分阶段配比利用才是多模态模型性能提升的关键。同时期InternVL3.5仅训练了1160M 样本(250B token,仅约InternVL1的1/5,约为qwen3vl的1/10)SFT阶段使用了600M(6亿条,是qwen3vl的500倍,但该阶段

文章图片
#人工智能#深度学习
论文阅读 | MiniCPM-o | RLAIF-V开源AI反馈助力模型可信度超越GPT-4V

解决现有多模态大语言模型的幻觉问题,突破传统RLHF依赖人工标注、现有RLAIF依赖专有模型的局限,通过全开源范式构建高质量反馈,实现模型可信度与人类偏好的对齐。核心创新去混淆响应生成:相同条件下多轮采样解码,消除文本风格干扰,凸显可信度真实差异;分而治之反馈标注:将响应拆解为原子声明,转换为极性问题评估,降低开源模型标注难度;迭代反馈学习:动态更新反馈分布,解决DPO训练中的分布偏移问题;推理自

文章图片
#论文阅读#人工智能#多模态 +1
    共 135 条
  • 1
  • 2
  • 3
  • 14
  • 请选择