
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文详解 Ryzen AI 与 Radeon 显卡本地部署大模型指南。通过 Ollama 和 LM Studio 工具,结合驱动优化与量化技术,让用户在 Windows 或 Linux 下轻松运行 Llama3 等模型。实测显示消费级 A 卡推理流畅,是体验本地 AI 的高效方案。
本文详解 Ollama 适配 AMD 显卡教程,解决本地运行大模型的显存焦虑。通过配置环境变量与 GGUF 量化模型,Radeon 用户可轻松部署 Llama3 等主流模型。文章对比 LM Studio 图形化方案,助力开发者低成本搭建高效 AI 工作站。
本文基于 DevCloud 实测 AMD Instinct MI300X GPU,验证其 HBM3 高带宽在大模型推理中的关键作用。测试显示,在 vLLM 框架下,MI300X 凭借 5.3 TB/s 带宽,于高并发场景稳定突破 150 tokens/s 吞吐,显著优化长上下文延迟,为硬件选型提供真实数据支撑。
本文通过手写 RCCL 测试脚本,实测八卡 AMD Instinct 集群的互联带宽与推理加速效果。文章详解拓扑检查、代码实现及性能调优,揭示如何避免通信瓶颈,实现大模型近乎线性的吞吐增长,为构建高效 AI 集群提供实战指南。

本文详解如何在单卡 Instinct MI300X 上利用 FP8 量化技术流畅运行 Llama 3.1 70B 大模型。通过 ROCm 7.x 与 vLLM 部署,FP8 将显存占用减半并释放带宽潜力,使吞吐量提升近 3 倍,有效解决显存瓶颈,助力大模型低成本高效落地。
本文详解如何利用 HIPify 工具将 CUDA 代码自动迁移至 AMD ROCm 生态。通过 hipify-clang 实现语法转换,解决大模型项目中的库映射与编译配置难题,助开发者高效完成代码移植,释放 AMD 显卡在大模型训练与推理中的高性价比潜力。

本文详解如何在 AMD MI300X 上利用 PagedAttention 优化解决大模型推理显存不足难题。通过 ROCm 7.x 环境搭建、vLLM 参数调优及 FP8 量化实战,成功在单卡部署 Llama3-70B,显著提升显存利用率与并发性能,为低成本大模型推理提供高效方案。
本文详解在 AMD Instinct 显卡上部署 vLLM 的实战流程,聚焦 ROCm 7.x 环境配置避坑指南。涵盖用户权限设置、驱动验证、源码编译关键变量及显存优化策略,助开发者快速搭建高效大模型推理服务,解决常见崩溃与兼容难题。
本文详解 Ryzen AI 与 Radeon 显卡本地部署大模型指南。通过 Ollama 和 LM Studio 工具,结合驱动优化与量化技术,让用户在 Windows 或 Linux 下轻松运行 Llama3 等模型。实测显示消费级 A 卡推理流畅,是体验本地 AI 的高效方案。
本文详解 PyTorch 项目从 CUDA 迁移至 AMD 平台的实战流程。针对 ROCm 7.x 环境,剖析 HIPify 自动化工具局限,解决自定义算子架构不匹配及 Triton 编译难题。通过手动修复与参数调优,成功在 MI300X 上实现高效推理,为开发者提供跨平台迁移指南。







