logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【计算机视觉 | MMYOLO】30 分钟实现自定义数据集训练与可视化(附完整代码)

本文详细介绍了如何使用MMYOLO框架在30分钟内完成自定义数据集的目标检测模型训练与可视化。内容涵盖从环境搭建、数据准备(COCO格式)、模型配置、训练监控到结果分析的完整流程,并提供了实用的避坑指南和代码示例,帮助初学者快速上手计算机视觉项目。

#计算机视觉#目标检测#深度学习
自动驾驶开发者必看:激光雷达点云与摄像头图像融合的5个关键步骤

本文为自动驾驶开发者详细拆解了激光雷达点云与摄像头图像融合的五个核心工程步骤。从传感器联合标定、时间同步,到坐标投影、数据着色及融合应用,提供了从理论到Python代码实现的完整实践指南,是实现鲁棒多模态感知系统的关键。

#自动驾驶
基于YOLOv5与IBVS的机器人视觉伺服完整链路实践

机器人视觉伺服是连接感知与运动控制的关键技术,其核心在于让机械臂依据图像反馈实时调整位姿。基于图像的视觉伺服(IBVS)通过在图像平面直接计算特征误差,并利用图像雅可比矩阵将其映射为笛卡尔速度指令,无需精确三维重建,对相机标定误差具有较强鲁棒性。结合深度学习目标检测方法(如YOLOv5),系统能够从语义层面稳定提取目标特征,有效克服传统视觉特征对光照和遮挡的敏感问题。该技术广泛应用于机器人抓取、视

机械臂强化学习避坑指南:从Panda-Gym环境搭建到Stable Baselines3实战

本文详细介绍了机械臂强化学习的实战指南,从Panda-Gym环境搭建到Stable Baselines3的应用,特别针对版本依赖、训练收敛和模型部署等常见问题提供解决方案。通过优化算法选择、超参数调优和实时性能优化,帮助开发者高效实现机械臂控制任务。

Diffusion_Autoencoder:为扩散模型注入可解释的语义之钥

本文深入解析Diffusion Autoencoder如何为扩散模型注入可解释的语义编码,解决传统扩散模型生成过程缺乏显式语义控制的痛点。通过创新的条件扩散架构与语义编码器设计,实现了图像重建与语义编辑的双重突破,为AI图像生成提供了更精准的控制手段。

Waymo数据集实战:从TFRecord到激光雷达点云的可视化处理

本文详细解析了Waymo数据集的TFRecord格式及其在自动驾驶领域的应用,重点介绍了激光雷达点云数据的提取与可视化技术。通过实战代码示例,展示了从TFRecord解码到点云可视化的完整流程,包括内存优化、并行解析和坐标转换等关键技巧,帮助开发者高效处理大规模自动驾驶数据集。

#自动驾驶
自动驾驶定位实战:如何用IMU和GPS实现厘米级精度(附ROS代码解析)

本文深入探讨了自动驾驶中实现厘米级定位的工程实践,重点解析了如何通过多传感器融合技术,将IMU的高频动态数据与GPS的绝对位置信息相结合。文章详细介绍了ROS环境下的数据同步、IMU预积分算法,并对比了扩展卡尔曼滤波与图优化两种融合框架,提供了可落地的代码解析与调试技巧,旨在解决实际开发中的定位漂移与跳变问题。

当扩散模型遇见强化学习:用LoRA微调技术打造轻量级轨迹生成器

本文探讨了扩散模型与强化学习的轻量化融合,通过LoRA微调技术实现高效轨迹生成。该方法仅需1/10的可训练参数即可达到接近全参数微调的效果,特别适合资源受限的智能体开发。文章详细介绍了LoRA层的实现、混合训练策略及性能优化技巧,为边缘设备部署提供了实用方案。

AI算力需求爆发:从英伟达财报透视大模型驱动的产业变革

在人工智能领域,算力是支撑模型训练与推理的核心基础设施,其重要性如同传统计算中的CPU。其工作原理基于GPU等专用硬件的大规模并行处理能力,通过CUDA等软件生态进行高效调度。这一技术的核心价值在于,它能将海量数据转化为智能,驱动科学研究与商业创新。当前,大语言模型(LLM)训练和推理已成为最主要的应用场景,其模型参数和数据量的指数级增长,直接引发了全球范围内对智能算力的结构性、爆发式需求。这种需

通用服务器跑千亿大模型:Yuan2.0在NF8260G7上的CPU-GPU协同推理实践

大语言模型推理正从专用加速器走向通用基础设施,而‘通用服务器跑大模型’已成为金融、政务、企业服务等场景落地的关键命题。其本质是突破显存墙、带宽墙与内存墙的三重约束,在有限硬件资源下实现低延迟、高吞吐、稳可用的生产级服务。核心技术路径包括CPU-GPU协同流水线、NUMA感知内存调度、PCIe带宽深度榨取及MoE动态权重预取——这些方案不依赖定制芯片或云专属实例,而是基于对NF8260G7等主流双路

    共 39 条
  • 1
  • 2
  • 3
  • 4
  • 请选择