logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

PyTorch 模型并行全解析:四种核心策略与选型指南

摘要:随着深度学习模型规模持续增长,从亿级到千亿参数的模型已成为常态,单 GPU 显存已难以满足训练与推理需求。PyTorch 提供了多种并行策略以应对这一挑战,但不同策略在显存效率、计算性能和实现复杂度方面差异显著,本文给出了各种并行策略的介绍与比较。

文章图片
#pytorch#人工智能
Git 实战:如何优雅解决 pull --rebase 时的合并冲突(含 VS Code 图形化操作指南)

摘要:本文介绍了如何解决 Git 中因 git pull --rebase 导致的合并冲突。

文章图片
#git
CPDet3D:面向室内外统一的稀疏监督 3D 目标检测新范式

本文是对论文《Learning Class Prototypes for Unified Sparse Supervised 3D Object Detection》的深度解读。在 3D 目标检测领域,现有稀疏监督方法仅适用于室外场景,难以适配室内场景特异性类别。南京理工大学等团队提出的 CPDet3D 方法,通过学习类别原型挖掘未标注目标,结合多标签协同优化,实现室内外统一稀疏监督检测,在 Sc

文章图片
#论文阅读
OpenEMMA:开源多模态端到端自动驾驶框架全解析

本文是对论文《OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving》的深度解读。在自动驾驶领域,端到端系统存在闭源限制、泛化不足等问题,德州农工大学等联合团队提出开源框架 OpenEMMA,基于多模态大语言模型,融合思维链推理与微调 YOLO 模型,实现轨迹规划与 3D 目标检测,打破闭源壁垒,提升系统效率

文章图片
#自动驾驶#论文阅读
Vision-Language-Action 模型在自动驾驶中的应用(VLA4AD)

本文是对论文《A Survey on Vision-Language-Action Models for Autonomous Driving》的深度解读。在自动驾驶领域,如何融合视觉、语言与动作实现可解释、安全的决策,是核心挑战。该研究首次全面梳理 VLA4AD 范式,追溯其从解释型模型到推理增强型模型的演进,详解架构设计、数据集、训练评估方法,剖析现存挑战与未来方向,为相关研究提供关键参考。

文章图片
#自动驾驶#人工智能#论文阅读
Lift, Splat, Shoot:自动驾驶多视图相机的 BEV 语义表示学习

本文是对论文《Lift, Splat, Shoot: Encoding Images from Arbitrary Camera Rigs by Implicitly Unprojecting to 3D》的深度解读。在自动驾驶感知领域,如何从多视图相机数据中构建统一且精准的BEV表示是核心挑战。论文团队提出的Lift-Splat-Shoot架构,通过 “提升 - 融合 - 规划” 三步流程,实现

文章图片
#自动驾驶#论文阅读
Sketchy-3DIS:草图边界框监督下的弱监督 3D 实例分割

本文是对论文《Sketchy Bounding-box Supervision for 3D Instance Segmentation》的深度解读。在 3D 实例分割领域,准确边界框标注获取困难的问题亟待解决。南开大学等团队提出的 Sketchy-3DIS 框架,创新性地采用草图边界框监督,通过自适应伪标签生成器与粗到精分割器联合训练,在 ScanNetV2 和 S3DIS 数据集上实现领先性能

文章图片
#论文阅读
OpenMonoGS-SLAM:单目高斯溅射 SLAM 与开放集语义理解的融合突破

本文是对论文《OpenMonoGS-SLAM: Monocular Gaussian Splatting SLAM with Open-set Semantics》的深度解读。在机器人、AR/VR 等领域,如何实现无深度传感器依赖的开放集语义 SLAM 是关键挑战。韩国成均馆大学与延世大学团队提出 OpenMonoGS-SLAM 框架,融合 3D 高斯 splatting 与视觉基础模型,通过语义

文章图片
#论文阅读
FeatureSLAM:实时特征增强的 3D 高斯溅射 SLAM 技术

本文是对论文《FeatureSLAM: Feature-enriched 3D gaussian splatting SLAM in real time》的深度解读。在 SLAM 领域,实时性、地图质量与语义理解的平衡是核心挑战。萨里大学与 I3D Robotics 团队提出的 FeatureSLAM,创新性地将 SAM2 多尺度特征与 3D 高斯溅射融合,实现实时在线 SLAM,支持开放集分割,

文章图片
#论文阅读
P2PNet:基于点的密集人群计数与定位

本文是对论文《Rethinking Counting and Localization in Crowds: A Purely Point-Based Framework》的深度解读。在人群分析领域,单纯计数已难以满足下游任务需求,现有方法存在中间表示冗余、定位不准等问题。腾讯优图实验室团队提出纯点基框架,设计 nAP 评估指标与 P2PNet 模型,通过一对一匹配策略直接预测头部中心点,实现计数

文章图片
#深度学习#论文阅读
    共 99 条
  • 1
  • 2
  • 3
  • 10
  • 请选择