
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要:随着深度学习模型规模持续增长,从亿级到千亿参数的模型已成为常态,单 GPU 显存已难以满足训练与推理需求。PyTorch 提供了多种并行策略以应对这一挑战,但不同策略在显存效率、计算性能和实现复杂度方面差异显著,本文给出了各种并行策略的介绍与比较。

摘要:本文介绍了如何解决 Git 中因 git pull --rebase 导致的合并冲突。

本文是对论文《Learning Class Prototypes for Unified Sparse Supervised 3D Object Detection》的深度解读。在 3D 目标检测领域,现有稀疏监督方法仅适用于室外场景,难以适配室内场景特异性类别。南京理工大学等团队提出的 CPDet3D 方法,通过学习类别原型挖掘未标注目标,结合多标签协同优化,实现室内外统一稀疏监督检测,在 Sc

本文是对论文《OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving》的深度解读。在自动驾驶领域,端到端系统存在闭源限制、泛化不足等问题,德州农工大学等联合团队提出开源框架 OpenEMMA,基于多模态大语言模型,融合思维链推理与微调 YOLO 模型,实现轨迹规划与 3D 目标检测,打破闭源壁垒,提升系统效率

本文是对论文《A Survey on Vision-Language-Action Models for Autonomous Driving》的深度解读。在自动驾驶领域,如何融合视觉、语言与动作实现可解释、安全的决策,是核心挑战。该研究首次全面梳理 VLA4AD 范式,追溯其从解释型模型到推理增强型模型的演进,详解架构设计、数据集、训练评估方法,剖析现存挑战与未来方向,为相关研究提供关键参考。

本文是对论文《Lift, Splat, Shoot: Encoding Images from Arbitrary Camera Rigs by Implicitly Unprojecting to 3D》的深度解读。在自动驾驶感知领域,如何从多视图相机数据中构建统一且精准的BEV表示是核心挑战。论文团队提出的Lift-Splat-Shoot架构,通过 “提升 - 融合 - 规划” 三步流程,实现

本文是对论文《Sketchy Bounding-box Supervision for 3D Instance Segmentation》的深度解读。在 3D 实例分割领域,准确边界框标注获取困难的问题亟待解决。南开大学等团队提出的 Sketchy-3DIS 框架,创新性地采用草图边界框监督,通过自适应伪标签生成器与粗到精分割器联合训练,在 ScanNetV2 和 S3DIS 数据集上实现领先性能

本文是对论文《OpenMonoGS-SLAM: Monocular Gaussian Splatting SLAM with Open-set Semantics》的深度解读。在机器人、AR/VR 等领域,如何实现无深度传感器依赖的开放集语义 SLAM 是关键挑战。韩国成均馆大学与延世大学团队提出 OpenMonoGS-SLAM 框架,融合 3D 高斯 splatting 与视觉基础模型,通过语义

本文是对论文《FeatureSLAM: Feature-enriched 3D gaussian splatting SLAM in real time》的深度解读。在 SLAM 领域,实时性、地图质量与语义理解的平衡是核心挑战。萨里大学与 I3D Robotics 团队提出的 FeatureSLAM,创新性地将 SAM2 多尺度特征与 3D 高斯溅射融合,实现实时在线 SLAM,支持开放集分割,

本文是对论文《Rethinking Counting and Localization in Crowds: A Purely Point-Based Framework》的深度解读。在人群分析领域,单纯计数已难以满足下游任务需求,现有方法存在中间表示冗余、定位不准等问题。腾讯优图实验室团队提出纯点基框架,设计 nAP 评估指标与 P2PNet 模型,通过一对一匹配策略直接预测头部中心点,实现计数








