logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

目标检测——Yolo系列(YOLOv1/2/v3/4/5/x/6/7/8)

Precision: 描述的是找对的概率Recall: 描述的是找全的概率一般来说,准确率和找回率不能同时兼顾,一个高另一个就相对变低。改变阈值(IOU大于一定的阈值,就被判为正样本),可以得到不同的precision和recall, 然后做出presion - recall 的图(一般叫做PR图)去上限求出与x轴围成的阴影的面积就是AP的值。如上图就是长方形A1,A2,A3,A4的面积之和。对每

文章图片
#目标检测#计算机视觉#深度学习
Python库(2)—— Pandas 数据分析处理库

Pandas —— 数据分析处理库安装Pandas: pip install pandasimport pandas as pdpd.show_versions() # 显示当前版本信息读取数据读数据pd.read_csv() : 读取csv类型数据df = pd.read_csv('./data/titanic.csv')df.head(n) : 显示前n条数据df.head(6) # head

文章图片
#python#pandas
无人驾驶领域的3D目标检测综述

本文的主要工作: 应用于自动驾驶领域的3D目标检测的进展背景&挑战:3D目标检测的背景以及面临的挑战方法&分析:从模型和传感器输入方面对3D目标检测的方法进行探讨。**应用:**研究了3D目标检测在驾驶系统中的应用性能分析&未来展望:对3D目标检测方法进行了性能分析,并进一步总结了多年来的研究趋势,展望了该领域的未来方向。自动驾驶,通过传感器感知周围的环境输入:多模态数据(来自摄像头的图像数据、来

文章图片
#3d#目标检测#人工智能
ROS机器人应用(3)——程序修改编译与SublimeText 简析

这一步是因为树莓派/Nano/TX2/NX/工控机的系统时间在没有连接互联网时,系统时间可能会混乱。同时我们程序修改是需要编译后才能生效的,而编译规则是只编译最新时间的修改,同时修改时间在未来即大于当前系统时间的不编译。-l2,l 是load-average 的意思,代表系统加载的任务数,数目一般与-j 的数。-j2,j 是job 的意思,代表允许2 个编译命令同时进行,一般是以CPU。官方下载链

#机器人
KITTI数据集解析和可视化

文章链接概述KITTI数据集是目前国际上最大的自动驾驶场景下的计算机视觉算法评测数据集。该数据集用于评测立体图像(stereo),光流(optical flow),视觉测距(visual odometry),3D物体检测(object detection)和3D跟踪(tracking)等计算机视觉技术在车载环境下的性能。KITTI包含市区、乡村和高速公路等场景采集的真实图像数据,每张图像中最多达1

#计算机视觉#深度学习#人工智能
Zero 1/2/3 介绍

微软开发的DeepSpeed库通过ZeRO技术优化大模型训练显存占用。ZeRO采用分片策略,将优化器状态、梯度和模型参数分散到不同GPU上,分为三个阶段:ZeRO-1仅分片优化器状态(显存节省4倍),ZeRO-2增加梯度分片(节省8倍),ZeRO-3进一步分片模型参数(显存随GPU数量线性下降)。ZeRO-2在显存节省和通信效率间取得最佳平衡,推荐作为通用方案;ZeRO-3适用于超大模型但通信开销

DDPM / DDIM / Flow Matching 详解

本文系统介绍了三种深度生成模型:DDPM、DDIM和Flow Matching。DDPM通过马尔可夫链实现噪声扩散与去噪过程,采样质量高但速度慢;DDIM采用非马尔可夫过程,支持跳步采样,在50步内即可获得高质量结果;Flow Matching通过连续归一化流直接学习向量场,训练稳定且采样高效。三者各有优势:DDPM理论完备,DDIM兼顾速度与质量,Flow Matching框架统一灵活。这些方法

DiT和MM-DiT详解

本文介绍了两种基于Transformer的扩散模型架构:DiT和MM-DiT。DiT用纯Transformer替代传统U-Net,通过Patchify处理图像输入,采用AdaLN注入条件信息,具有优秀的可扩展性。MM-DiT扩展为双流Transformer,支持图像和文本的双向交互,通过交叉注意力实现多模态深度融合,显著提升了文本到图像生成的质量。两种架构都展现了Transformer在扩散模型中

文章图片
KV Cache 详解

KV Cache是Transformer解码器在自回归推理中的关键优化技术。它通过缓存历史token的Key和Value矩阵,避免重复计算,将单步复杂度从O(t²)降至O(t)。该技术显著降低推理延迟,但会带来线性增长的显存开销。优化方案包括MQA、GQA、PagedAttention和量化缓存等。KV Cache已成为大模型高性能服务的基础组件,但面临长序列显存消耗和批处理不友好等挑战。

VAE/VQ-VAE

VAE(变分自编码器)通过将输入映射为概率分布并约束隐空间为标准正态分布,实现连续隐空间和样本生成,但存在生成结果模糊的问题。VQ-VAE(矢量量化变分自编码器)引入离散码本和自回归先验,通过量化编码器输出为离散向量,结合强大的自回归模型生成更清晰的样本。VAE适合平滑插值和连续数据生成,而VQ-VAE在图像、语音等离散特征明显的任务中表现更优,但训练复杂度更高。两者在隐空间结构、生成质量和应用场

文章图片
    共 51 条
  • 1
  • 2
  • 3
  • 6
  • 请选择