logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

基于Yolo的图像识别中的特征融合

本文摘要:文章系统分析了YOLO网络中的特征融合技术,重点对比了单模态(RGB)与多模态(RGBT)融合的差异。在单模态YOLO中,特征融合通过Concat操作实现不同层次特征的拼接;而多模态融合需要处理RGB与红外等异构数据的对齐与互补,采用更复杂的CBLinear和CBFuse模块。研究以YOLOv11-RGBT项目为例,解析了其融合机制:CBLinear生成多尺度引导特征,CBFuse实现跨

文章图片
#计算机视觉
解决Docker Desktop 的 WSL2安装失败的问题

本文解决docker desktop 自动安装WSL时显示已禁止(403)的问题,单纯的使用管理员模式和其他指令是无法解决的。这是WSL的版本发布界面,找到对应Windows的x86安装包下载,下载完成后点击就可以自动安装。安装完后重启docker desktop,可以看到可以进行正常登陆了。

文章图片
#docker#容器#运维
阅读:基于深度学习的红外可见光图像融合综述

本文主要针对综述的IVIF方法进行了分类总结,但由于第一次整理,很多地方由于积累浅薄存在一定的问题,将会在后续的写作中持续完善。x。

文章图片
#深度学习#图像处理#机器学习 +1
阅读:基于深度学习的红外与可见光图像融合综述: 发展与展望

本文综述了基于深度学习的红外与可见光图像融合(IVIF)方法的研究进展。传统IVIF方法存在特征提取不足、融合规则复杂等问题。近年来,基于深度学习的方法主要包括:1)CNN方法通过卷积网络自动学习特征,具有端到端优势;2)自编码器方法通过编码-解码结构实现无监督训练;3)GAN方法利用对抗机制生成高质量融合图像;4)Transformer方法通过自注意力捕获全局依赖关系。各类方法在特征提取、融合规

#深度学习#人工智能#计算机视觉 +2
对IVIF深度学习的主流方法学习和理解

本文分析了基于深度学习的红外与可见光图像融合(IVIF)方法。首先提出了统一的IVIF框架,将其分解为7个核心环节:输入、预处理、特征提取、特征交互与融合、特征重构、监督策略和优化更新。基于此框架,将现有方法分为两类:框架家族(CNN、AE、GAN)和组件家族(注意力、状态空间、图结构、函数逼近)。框架家族可独立完成端到端融合流程,而组件家族主要用于增强特征交互能力。通过横向对比各家族在各个环节的

文章图片
#深度学习#人工智能#神经网络 +2
基于Docker Desktop 和 Ubuntu 在 Windows上部署轻量化大模型(Qwen-LLM)

本文详细介绍了在本地部署Qwen大语言模型的完整流程。通过Docker容器化技术实现模型轻量化部署,利用WSL子系统在Windows环境下搭建Ubuntu环境,并针对常见安装问题提供解决方案。文章包含显存-模型适配对照表、模型下载与测试方法、Docker容器构建步骤,以及使用Tailscale实现内网穿透的分布式部署方案。整个过程涉及环境配置、模型量化、性能测试等关键环节,为开发者提供了从零开始部

文章图片
#docker#ubuntu#容器 +1
图文跨模态融合基础 1 :大语言模型(LLM)

LLM(Large Language Model)大型语言模型LLM)是一种利用自监督机器学习方法,基于海量文本训练而成的语言模型,专为自然语言处理任务而设计,尤其适用于语言生成。

文章图片
#语言模型#人工智能#自然语言处理
笔记:LoRA,一种针对大语言模型的参数高效微调方法

LoRA(低秩自适应)是一种高效的大语言模型微调方法。其核心思想是假设模型适配时的权重更新矩阵具有低内在秩,通过在原始线性层旁路引入低秩矩阵进行参数更新,而不改变预训练权重。该方法将权重更新分解为两个低秩矩阵的乘积,显著减少可训练参数(GPT-3场景下可减少1万倍),同时保持与全量微调相当的效果。LoRA具有三大优势:1)参数高效,显存占用降低3倍;2)训练吞吐量提升25%;3)部署灵活,可合并回

文章图片
#语言模型#人工智能
笔记:对yolov8网络代码的学习

本文详细解析了YOLOv8的模型结构与实现细节。主要内容包括:1. 模型获取方式(下载完整代码或单独yaml文件);2. 网络结构总览,包含Backbone(CSPDarknet)、Neck(PAN-FPN)和Head(解耦检测头);3. Backbone部分详解,重点分析Conv、C2f和SPPF模块的作用及参数设置;4. Neck部分的特征融合机制,解释上下采样的实现原理;5. Head部分的

文章图片
#学习#神经网络
笔记:对MoE混合专家模型的学习和思考

本文对比分析了稠密模型(Dense Model)和混合专家模型(MoE)两种大语言模型架构。稠密模型采用全参数激活机制,而MoE通过"路由选择+专家分工"实现稀疏激活,仅调用部分专家网络处理输入,在保持大容量的同时降低计算成本。MoE的核心流程包括输入、路由打分、专家计算、结果聚合和输出五个步骤,其中路由器根据输入特征动态选择最匹配的专家。文章还详细介绍了MoE的路由机制、专家

文章图片
#学习#自然语言处理#语言模型 +1
    共 15 条
  • 1
  • 2
  • 请选择