logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

你的 GPU 为什么只能跑 20%?大模型训练通信瓶颈的四层排查 SOP

《大模型训练通信瓶颈排查指南》摘要:本文针对分布式训练中通信瓶颈问题,提出一套自底向上的排查SOP。首先通过nccl-tests测试物理网络带宽,确保RDMA正常;其次用NCCL_DEBUG检查通信路径;再通过Prometheus+Grafana监控和Profiler分析定位代码层问题;最后调整BucketSize优化通信效率。文章强调通信优化需要系统性地逐层排查,从物理层到应用层缺一不可,才能将

文章图片
你以为你在训练大模型,其实你在烧钱打水漂——分布式训练的四个致命陷阱

H100 一张卡的售价能买一辆轿车,一个千卡集群的电费一天就够普通人吃几年。可即便砸下这么多钱,绝大多数团队真正用上的算力,可能还不到硬件理论巅峰的30%。程序还在跑,损失还在降,监控里 GPU 利用率显示 100%——所有指标都告诉你一切正常,但你其实是在原地烧钱。这篇博客把分布式训练里最常见、也最隐蔽的四个坑摊开来讲清楚。每一个我都会用两层语言来解释:先是工程师视角的硬核原理,再用一个生活化的

文章图片
#分布式
深度学习性能调优全景指南:数据、计算、显存、通信四大瓶颈的破局之道

本文系统梳理了大规模深度学习训练中的四大性能瓶颈及其优化策略:数据瓶颈(GPU等待数据)可通过多进程加载、锁页内存、预取等技术优化;计算瓶颈(GPU利用率低)可通过混合精度、算子融合、JIT编译提升效率;显存瓶颈(OOM错误)可通过激活检查点、梯度累积、参数分片缓解;通信瓶颈(多卡扩展性差)可通过梯度分桶、计算通信重叠、RDMA加速优化。文章强调性能调优的核心在于先用Profiler准确定位瓶颈,

文章图片
#深度学习#GPU
大规模深度学习性能调优:自顶向下的五件套

摘要:本文介绍了深度学习性能调优的全栈工具链,从框架层到硬件层的五件套排查方案:1. PyTorch Profiler快速定位算子瓶颈;2. Nsight Systems分析系统级时间线;3. Nsight Compute深入Kernel微架构;4. NCCL_DEBUG排查分布式通信问题;5. nvidia-smi监控硬件状态。作者强调自顶向下的调优策略,指出不同层级工具的开销差异,并给出典型场

文章图片
#深度学习#人工智能
训练 vs 推理:深度学习工程化中最容易被忽视的“两套世界观“

摘要:本文系统对比了深度学习训练与推理优化的核心差异。训练优化追求长周期吞吐和稳定性,关注GPU利用率、显存峰值和分布式通信效率;推理优化则聚焦低延迟、高并发和尾延迟治理,强调动态批处理、算子融合和量化技术。两者在评价指标、系统瓶颈和技术栈上存在根本性差异:训练工程师关注"填满流水线",而推理工程师专注"消除抖动"。理解这些差异对选择优化策略和框架至关重要,

文章图片
#深度学习#人工智能
算力拉满,GPU 却在摸鱼:深度学习里的访存瓶颈

本文揭示了性能优化中的核心问题:瓶颈往往不在算力,而在数据搬运。通过两个典型案例(LayerNorm精度转换无效和GPU利用率低下)分析,指出优化前需先用Roofline模型区分算力受限(Compute-bound)和带宽受限(Memory-bound)场景。 对于带宽受限算子(如LayerNorm),优化重点应是减少数据搬运量,可采用FP16存储或算子融合;对于CPU-GPU传输瓶颈,关键要确保

文章图片
显存都去哪了:从 FP32 Master Weight 讲透大模型训练的显存账本

这篇文章深入解析了大模型训练中显存占用的核心问题,重点阐述了FP32 Master Weight的作用和取舍。通过记账的比喻,作者形象地解释了混合精度训练的本质:用低精度(FP16/BF16)进行高效计算,同时保留高精度(FP32)主权重确保数值稳定性。文章详细对比了FP16和BF16的差异,指出BF16凭借更大的数值范围更适合深度学习训练。在显存估算方面,作者给出了具体计算公式:10B参数的模型

文章图片
#机器学习
训练数据不该“先搬后用“:聊聊 TOS PyTorch Connector 到底解决了什么

文章摘要: TOSPyTorchConnector通过流式加载和最短路径设计,解决了大模型训练中数据加载的"最后一公里"问题。相比传统预热或文件系统挂载方式,它直接从对象存储读取数据,省去了本地副本管理和协议转换开销。该工具提供两种数据集类型和检查点接口,支持随机访问和流式读取,实测吞吐量可达传统方式的20倍。其核心价值在于将对象存储变为可直接读取的数据源,尤其适合PB级大规模

文章图片
#pytorch#人工智能#python
Seata 全景拆解:AT、TCC、Saga 该怎么选?告别“一把梭”的架构误区

Seata分布式事务模式深度解析 摘要: Seata作为阿里开源的分布式事务解决方案,提供AT、TCC、Saga和XA四种模式。本文从架构师视角对比分析三种主流模式:AT模式通过全局锁实现自动事务管理,适合简单CRUD但存在性能瓶颈;TCC模式通过资源预留保证强一致性,适合核心资金链路但开发复杂;Saga模式采用补偿机制处理长事务,适合跨系统业务但缺乏隔离性。文章深入剖析各模式原理、适用场景及实战

文章图片
#分布式#架构
PostgreSQL 和 MySQL 的 MVCC 到底有什么区别?从底层存储机制讲透

PostgreSQL和MySQL的MVCC实现差异主要体现在版本存储方式上:PostgreSQL采用"表内版本堆"模式,所有版本都存储在表文件中,通过xmin/xmax判断可见性,更新操作会追加新版本并标记旧版本过期,这种设计使得回滚快速但容易导致表膨胀;MySQL InnoDB则采用"主表+Undo日志"模式,当前版本存储在聚簇索引中,历史版本保存在Und

文章图片
#postgresql#mysql#数据库
    共 172 条
  • 1
  • 2
  • 3
  • 18
  • 请选择