登录社区云,与社区用户共同成长
邀请您加入社区
在 AMD Instinct GPU 上部署多租户模型服务时,K8s 默认的进程级隔离会出现显存竞争与计算抢占问题。本文通过实测 ROCm 5.6 环境下的隔离方案,揭示 PCIe 通道竞争、缓存污染等边界条件,给出包含内核参数调优、硬件校验在内的加固清单,并通过性能对比表展示不同虚拟化方案的取舍,帮助 AI 工程团队控制故障爆炸半径。
本文深入解析了RTX 4090在AI画图时算力无法跑满的原因,重点探讨了FP32与FP64浮点运算精度的硬件设计差异。通过对比游戏显卡与专业计算卡的架构特点,揭示了NVIDIA在算力分配上的策略,并提供了优化GPU性能的实用技巧,帮助用户最大化利用RTX 4090的AI计算潜力。
本文详细解析了Windows双显卡(独显+核显)设备在运行Vulkan游戏时常见的闪退问题,提供了从诊断到解决的全套方案。通过Vulkan硬件检查工具、显卡驱动更新、系统设置调整等方法,帮助玩家确保游戏正确调用独立显卡运行Vulkan应用,提升游戏性能和稳定性。
摘要 本文记录了在双RTX 5090工作站上部署NVIDIA Isaac Sim 6.0和Isaac Lab的全过程,重点解决了新硬件环境下的兼容性问题。主要步骤包括: 确认硬件配置满足要求,特别注意Blackwell架构对CUDA 13+的需求 创建独立的Python 3.12环境(官方要求) 安装Isaac Sim 6.0时遇到并解决了--prerelease参数问题 验证PyTorch cu
本文分享 TileLang 在 AMD GPU 上的调试经验,利用 rocprof 精准定位内核性能瓶颈。通过动态分块、消除线程束发散及流水线重叠三大方法,有效解决内存墙与计算延迟问题,助力开发者实现大模型算子的高效优化。
vLLM 是一款专为大语言模型推理加速而设计的框架,实现了 KV 缓存内存几乎零浪费,解决了内存管理瓶颈问题。更多 vLLM 中文文档及教程可访问 →。
NCCL和custom allreduce(应该就是指one-shot和two-shot以及half-bufferfly那些,小数据量通信情况下,降低延迟用的)原理就是新到request的prefill,不阻塞正在decode的request。和continous batching一起使用时,为什么加速比和qps有关?qps上来以后,延迟能有明显的优化。
AMD 表示,它有望在 5 月底发布其微引擎调度程序 (MES) 文档,随后发布源代码。然后,它将继续以开源方式发布 Radeon 堆栈的其他部分。该声明似乎是为了回应Tiny Corp 的 Tweet/X,该公司几个月来一直在社交媒体上公开与 AMD 通信(并经常批评)。
Context Roll 是AMD GPU 流水线状态更新的核心机制,本文基于AMD官方文档、开源驱动代码(PAL)以及Radeon GPU Profiler 工具的使用,探讨以下三个问题:硬件是如何实现低开销的流水线状态切换的?寄存器组的消耗在哪些场景会造成性能瓶颈?RGPcontext roll栏目对开发者有什么帮助?
本文深入解析了Linux DRM框架下AMD Radeon显卡驱动的初始化机制,重点剖析了radeon_driver_load_kms函数的实现细节。通过源码分析,详细介绍了从PCI设备探测到KMS初始化的完整流程,包括GPU硬件初始化、显示子系统设置以及错误处理机制,为内核开发者和图形系统研究者提供了宝贵的技术参考。
本文深入解析了Linux内核中Radeon显卡驱动的初始化流程,从PCI设备探测到DRM核心加载,详细介绍了drm_get_pci_dev和radeon_driver_load_kms的关键步骤。通过源码分析,揭示了Radeon驱动如何与GPU硬件交互,为开发者提供了宝贵的调试和优化经验。
radeon_fence文件源码分析/*** radeon_fence_driver_init - init the fence driver* for all possible rings.** @rdev: radeon device pointer** Init the fence driver for all possible rings (all asics).* Not all asi
AMD并没有完全抛弃移动市场。AMD Radeon科技组的VP兼首席架构师Raja Koduri说,公司的Radeon生产线开始生产移动设备的图形处理器,但是并不广泛。AMD可能只作为合作方之一或者遵守许可协议来生产GPU,并没有发布完整产品的计划。Koduri这周说。AMD的主要业务是为PC和嵌入式设备生产GPU。2009年,也和Qualcomm合作生产过移动设备的GPU,叫做Adreno,..
vLLM 是一款专为大语言模型推理加速而设计的框架,实现了 KV 缓存内存几乎零浪费,解决了内存管理瓶颈问题。更多 vLLM 中文文档及教程可访问 →从 vLLM 0.3.3 版本起,支持在带有 Neuron SDK 的 AWS Trainium/Inferentia 上进行模型推理和服务。目前 Neuron SDK 不支持分页注意力 (Paged Attention),但 Transformer
vLLM 是一款专为大语言模型推理加速而设计的框架,实现了 KV 缓存内存几乎零浪费,解决了内存管理瓶颈问题。更多 vLLM 中文文档及教程可访问 →由 OpenVINO 驱动的 vLLM 支持来自 vLLM 支持的模型列表 <…/models/supported_models> 中的所有 LLM 模型,并且可以在所有 x86-64 CPU 上(至少需要 AVX2 支持)进行最佳的模型服务。
- AMD 发布 Instella:全新 SOTA 全开源 30 亿参数语言模型- 上海交大发布 AI 教育教学规范,引领高校 AI 治理新方向
如果说地球上有哪个市场迫切需要激烈的竞争,那就是推动人工智能革命的数据中心 GPU 市场。
本文介绍了在Windows平台上使用ROCm 7.1自动化编译Ollama AMD GPU版本的全流程。相较于早期手动编译的复杂操作,新方案通过一键脚本实现了高效构建,支持RDNA 3.5等新架构。文章详细解析了硬件兼容性检查、环境依赖配置、脚本参数说明及底层编译原理,并提供了手动调试指南。该方案显著提升了编译效率,特别针对RX 7000系列显卡进行了优化,使Windows用户能够便捷地部署AMD
如果你手头有 AMD 显卡,不妨试试,`torch.cuda.*` 的代码一行都不用改。其实 AMD 的 ROCm(Radeon Open Compute)生态在过去两年进步巨大——PyTorch 2.x 已经原生支持 ROCm,`torch.cuda.*` 的代码不用改就能在 AMD 显卡上跑。**2. `hipErrorOutOfMemory` 错误**——设置 `PYTORCH_ALLOC_
贯穿整个GDR技术演进的核心挑战始终如一:如何安全、高效地将应用程序层面使用的GPU虚拟地址,转换为一组RDMA网卡DMA引擎能够理解并直接使用的物理地址(或总线地址)。无论的回调机制,还是dma-buf的操作,本质上都是在解决这一关键的地址翻译问题,因此,GPU驱动中如何高效组织和管理进程使用设备内存是需要好好考量的要点。
vLLM虽支持多GPU并行,但对异构混合部署支持有限,仅推荐在同架构、同厂商的NVIDIA显卡上运行。跨代际或跨厂商组合易导致兼容问题和性能下降,生产环境应优先选择A100/H100等数据中心级GPU以确保稳定性。
本文深入解析了Linux内核中Radeon显卡驱动的初始化流程,从硬件识别到驱动加载的完整过程。详细介绍了从drm_get_pci_dev到radeon_driver_load_kms的关键步骤,包括PCI设备匹配、DRM框架介入、Radeon专属初始化等核心环节,帮助开发者理解GPU驱动的工作原理和调试方法。
本文深入解析了Linux内核中Radeon显卡驱动的完整启动流程,从PCI设备探测到DRM框架加载,再到KMS初始化。通过源码分析,详细介绍了drm_get_pci_dev和radeon_driver_load_kms等关键函数的实现机制,帮助开发者理解Radeon GPU在Linux系统中的初始化过程及其核心数据结构。
减少max_num_seqs或max_num_batched_tokens。减少一个batch里的请求、token个数,从而减少KV cache占用。显存不够的时候,某些request会被抢占。其KV cache被清除,腾退给其他request,下次调度到它,重新计算KV cache。可以查看VLLM自带的Prometheus指标,查看抢占的请求数量。- 增大gpu_memory_utilizat
API Shader Stage Control
上一篇讲到了drm_get_pci_dev函数,这是一个比较关键的函数,其中调用了几个函数,现在一一进行详细说明。先说第1个函数:drm_dev_alloc。调用处:dev = drm_dev_alloc(driver, &pdev->dev);源码如下:drivers/gpu/drm/drm_drv.c/*** drm_dev_alloc - Allocate new DRM de
radeon gpu profiler 的用法,本文翻译 EventWindow 的第一部分(非机翻)AMD-RGP 的Events Windows 一共有五个部分(Wavefront occupancy、Event timing、The anatomy of an event、Pipeline state、Instruction timing),本文翻译前三部分。
在计算机体系结构中,桥片(Southbridge/Northbridge)与图形处理单元(GPU)是连接CPU与外部设备、实现高效数据交换和图形渲染的关键组件。其核心原理在于通过高速互连总线(如PCIe、HT)和专用控制器,管理内存、存储、网络及显示输出。这一技术体系的价值在于决定了整机系统的扩展性、兼容性与用户体验,是构建桌面、服务器及嵌入式解决方案的基础。随着自主可控需求的提升和开源生态的成熟
在现代计算系统中,芯片组(Chipset)作为CPU与外围设备的核心互联枢纽,其提供的PCIe通道、内存控制器及高速I/O接口性能,直接决定了系统的数据吞吐与扩展能力。图形处理单元(GPU)则负责图形渲染与并行计算,其API支持度与驱动成熟度深刻影响用户体验与软件生态。理解桥片与GPU的工作原理,对于构建高性能、高能效的计算平台至关重要,其技术价值在于消除系统瓶颈,释放CPU算力,实现各子系统间的
计算存储加速是解决现代数据中心'存储墙'瓶颈的关键技术,其核心原理是将计算任务卸载到靠近数据源的专用硬件上执行,从而减少数据搬运开销,提升系统整体能效。从技术实现上看,主要分为基于定制化数据流处理的FPGA方案和基于大规模并行计算的GPU方案。FPGA通过硬件描述语言构建专用流水线,擅长低延迟、确定性的流式处理,如实时数据过滤、协议解析和加密解密,能有效卸载CPU负担。GPU则依托其海量计算核心与
AMD Instinct MI300X GPU 旨在通过紧凑高效的设计,提升 AI 和 HPC 计算能力。这些下一代 GPU 现已在 DigitalOcean 上提供,采用单租户裸金属配置,适用于需要更高控制力和计算能力的客户。MI300X 通过每个节点八块 GPU、高计算单元数量和 HBM3 内存容量,提供强劲的加速性能。此外,ROCm 开发者资源支持多个 AI 和 HPC 框架、领先的软件平台
AMD与Meta宣布扩大战略合作,达成一项为期多年、总量达6吉瓦(GW)的AMD Instinct GPU供应协议。此次合作涉及定制芯片、系统及软件层面的深度协同,旨在为Meta的大规模AI工作负载构建高性能、高能效的基础设施。
本文是对的Radeon GPU Profiler(RGP)的学习记录,原文是AMD的官网介绍,本文翻译overview部分。主要涉及Frame summary 、Barriers、 Context rolls 、Most expensive events、Pipelines这几个部分。
在启动参数中传入radeon.hard_reset=1这一参数,实际上是给模块参数赋了值,模块参数所在文件及代码为:drivers/gpu/drm/radeon/radeon_drv.cint radeon_hard_reset = 0;MODULE_PARM_DESC(hard_reset, "PCI config reset (1 = force enable, 0 = disable (de
GPU(Graphics Processing Unit,图形处理器)是一种专门设计用于处理图形和并行计算任务的微处理器。最初GPU主要用于计算机图形渲染,但随着技术的发展,现代GPU已经成为并行计算、人工智能、科学计算等领域不可或缺的核心组件。