logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Ryzen AI 与 Radeon GPU 本地大模型实战效果全景

本文深度实测 AMD Strix Halo 架构下 Ryzen AI 与 Radeon GPU 的本地大模型表现。通过 Ollama 和 LM Studio 部署,验证统一内存架构如何打破显存瓶颈,实现 32B 模型流畅推理。文章涵盖代码生成、逻辑推理及长文本处理场景,展示其在保障数据隐私下的端侧 AI 算力优势。

文章图片
#Strix Halo
AMD MI300X 性价比分析,大模型训练到底省多少钱

本文深度分析 AMD MI300X 在大模型训练中的性价比优势。针对 Llama 3.1 405B 等超大参数模型,MI300X 凭借 192GB 大显存打破显存墙,显著降低硬件数量与通信开销。结合 ROCm 生态优化,该方案有效减少总体拥有成本,是团队实现降本增效的关键选择。

文章图片
Docker 容器化部署 ROCm,多卡并行训练不再难

本文详解 Docker 容器化部署 ROCm 7.x 的最佳实践,解决 AMD GPU 环境配置难题。通过官方镜像、关键设备参数及多卡并行优化,实现高效深度学习训练。结合 GPU Operator 自动化调度,助力从单机到集群的平滑扩展,大幅提升开发效率。

文章图片
用 vLLM 在 Instinct GPU 上部署大模型,推理速度实测

## 环境准备:告别依赖地狱以前在 AMD GPU 上跑大模型,最让人头大的往往不是模型本身,而是环境配置。驱动版本不对、HIP 库缺失、PyTorch 编译报错,这些“最后一公里”的问题能消磨掉大半热情。但自从 ROCm 7.x 发布后,情况有了质的变化。特别是对于想要快速上线推理服务的团队,AMD 推出的“即插即用”容器化方案简直是把我们从手动编译的泥潭里拉了出来。这次我们直接在 DevClo

文章图片
迁移效果到底咋样,AMD 显卡跑大模型的显存与延迟实测数据

本文实测 AMD 显卡运行大模型的性能,对比 NVIDIA 平台在显存占用、吞吐量及延迟上的表现。数据显示,在高并发场景下,结合 SGLang 与 TileLang 优化的 AMD ROCm 方案吞吐量提升显著,显存效率更优,为大模型推理提供了高性价比的迁移选择。

文章图片
不用 NVIDIA 也能玩大模型,HIPify 加 SGLang 的低成本落地方案

本文详解不用 NVIDIA 也能玩大模型的低成本方案。通过 HIPify 自动化迁移代码,结合 SGLang 构建高吞吐推理服务,并利用消费级 AMD 显卡实现大模型落地。该方案有效降低算力成本,助力初创团队掌握异构计算主动权。

文章图片
#HIPify
从零搭建 ROCm 开发环境,Docker 容器化部署避免系统污染

本文详解从零搭建 ROCm 开发环境,利用 Docker 容器化部署避免系统污染。通过构建预装 HIPify 与 SGLang 的镜像,解决 AMD GPU 驱动依赖难题,实现大模型推理任务的高效迁移与隔离运行,大幅提升开发效率。

文章图片
Instinct GPU 显存优化技巧,让大模型跑得更稳

本文详解 AMD Instinct GPU 显存优化技巧,涵盖 PagedAttention 参数调优、gpu-memory-utilization 安全设置及 FP8 量化落地。通过精细化配置解决大模型推理 OOM 难题,显著提升 ROCm 环境下服务稳定性与吞吐效率。

#Instinct GPU
对比 NVIDIA 与 AMD 在大模型推理上的异同

本文深度对比 NVIDIA 与 AMD 在大模型推理上的异同,聚焦 ROCm 7.x 环境下的驱动配置、源码编译及显存优化策略。通过分析 vLLM 在两大平台的性能表现,为开发者提供兼顾生态便利与硬件性价比的选型建议,助力高效构建大模型推理服务。

#vLLM
打造高可用的 AMD 大模型推理服务架构

本文详解如何基于 AMD Instinct GPU 与 vLLM 构建高可用大模型推理服务。通过多副本部署、智能负载均衡及自动化故障转移策略,解决单点故障难题,确保生产环境稳定运行,打造坚实的 AMD 大模型推理服务架构。

#负载均衡
    共 163 条
  • 1
  • 2
  • 3
  • 17
  • 请选择