logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

本地电脑也能跑大模型,Ryzen AI 加 Radeon 显卡的 Ollama 部署指南

本文详解 Ryzen AI 与 Radeon 显卡本地部署大模型指南。通过 Ollama 和 LM Studio 工具,结合驱动优化与量化技术,让用户在 Windows 或 Linux 下轻松运行 Llama3 等模型。实测显示消费级 A 卡推理流畅,是体验本地 AI 的高效方案。

#Ollama
本地也能跑大模型,Ollama 适配 AMD 显卡教程

本文详解 Ollama 适配 AMD 显卡教程,解决本地运行大模型的显存焦虑。通过配置环境变量与 GGUF 量化模型,Radeon 用户可轻松部署 Llama3 等主流模型。文章对比 LM Studio 图形化方案,助力开发者低成本搭建高效 AI 工作站。

#Ollama
拒绝纸上谈兵,DevCloud 上实测 Instinct GPU 的高带宽推理性能

本文基于 DevCloud 实测 AMD Instinct MI300X GPU,验证其 HBM3 高带宽在大模型推理中的关键作用。测试显示,在 vLLM 框架下,MI300X 凭借 5.3 TB/s 带宽,于高并发场景稳定突破 150 tokens/s 吞吐,显著优化长上下文延迟,为硬件选型提供真实数据支撑。

#DevCloud#vLLM
手搓脚本实测,八卡 Instinct 集群如何实现近乎线性的推理加速

本文通过手写 RCCL 测试脚本,实测八卡 AMD Instinct 集群的互联带宽与推理加速效果。文章详解拓扑检查、代码实现及性能调优,揭示如何避免通信瓶颈,实现大模型近乎线性的吞吐增长,为构建高效 AI 集群提供实战指南。

文章图片
显存不够别硬撑,FP8 量化让 70B 大模型在单卡 Instinct 上流畅运行

本文详解如何在单卡 Instinct MI300X 上利用 FP8 量化技术流畅运行 Llama 3.1 70B 大模型。通过 ROCm 7.x 与 vLLM 部署,FP8 将显存占用减半并释放带宽潜力,使吞吐量提升近 3 倍,有效解决显存瓶颈,助力大模型低成本高效落地。

从零开始迁移大模型,HIPify 自动转换代码的详细步骤解析

本文详解如何利用 HIPify 工具将 CUDA 代码自动迁移至 AMD ROCm 生态。通过 hipify-clang 实现语法转换,解决大模型项目中的库映射与编译配置难题,助开发者高效完成代码移植,释放 AMD 显卡在大模型训练与推理中的高性价比潜力。

文章图片
#HIPify
大模型推理显存不够用,试试 AMD MI300X 上的 PagedAttention 优化

本文详解如何在 AMD MI300X 上利用 PagedAttention 优化解决大模型推理显存不足难题。通过 ROCm 7.x 环境搭建、vLLM 参数调优及 FP8 量化实战,成功在单卡部署 Llama3-70B,显著提升显存利用率与并发性能,为低成本大模型推理提供高效方案。

#vLLM
AMD Instinct 显卡上跑 vLLM,ROCm 7.x 环境配置避坑实录

本文详解在 AMD Instinct 显卡上部署 vLLM 的实战流程,聚焦 ROCm 7.x 环境配置避坑指南。涵盖用户权限设置、驱动验证、源码编译关键变量及显存优化策略,助开发者快速搭建高效大模型推理服务,解决常见崩溃与兼容难题。

#vLLM
本地电脑也能跑大模型,Ryzen AI 加 Radeon 显卡的 Ollama 部署指南

本文详解 Ryzen AI 与 Radeon 显卡本地部署大模型指南。通过 Ollama 和 LM Studio 工具,结合驱动优化与量化技术,让用户在 Windows 或 Linux 下轻松运行 Llama3 等模型。实测显示消费级 A 卡推理流畅,是体验本地 AI 的高效方案。

#Ollama
从 CUDA 到 HIP,手把手教你把 PyTorch 项目迁移到 AMD 平台

本文详解 PyTorch 项目从 CUDA 迁移至 AMD 平台的实战流程。针对 ROCm 7.x 环境,剖析 HIPify 自动化工具局限,解决自定义算子架构不匹配及 Triton 编译难题。通过手动修复与参数调优,成功在 MI300X 上实现高效推理,为开发者提供跨平台迁移指南。

    共 80 条
  • 1
  • 2
  • 3
  • 8
  • 请选择