logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

HIP 编程基础入门,从 CUDA 思维切换到 AMD 异构计算

本文详解 HIP 编程基础,指导开发者从 CUDA 思维平滑切换至 AMD 异构计算。通过解析显存管理、线程同步及矩阵乘法优化实战,揭示跨平台开发核心差异,助您掌握高性能 GPU 编程技巧,构建不依赖单一厂商的通用算力解决方案。

别再手动编译了,用 Docker 在 Instinct GPU 上三分钟跑通 vLLM

本文详解如何利用 Docker 在 AMD Instinct GPU 上三分钟快速部署 vLLM。借助 ROCm 7.x 官方预构建镜像,开发者可彻底告别手动编译地狱,轻松实现 Llama 3.1 等模型的高效推理。文章涵盖 BF16/FP8 精度配置及性能实测,助您大幅降低环境配置成本,加速大模型服务上线。

#vLLM
显存不够别硬撑,FP8 量化让 70B 大模型在单卡 Instinct 上流畅运行

本文详解如何在单卡 Instinct MI300X 上利用 FP8 量化技术流畅运行 Llama 3.1 70B 大模型。通过 ROCm 7.x 与 vLLM 部署,FP8 将显存占用减半并释放带宽潜力,使吞吐量提升近 3 倍,有效解决显存瓶颈,助力大模型低成本高效落地。

从零开始迁移大模型,HIPify 自动转换代码的详细步骤解析

本文详解如何利用 HIPify 工具将 CUDA 代码自动迁移至 AMD ROCm 生态。通过 hipify-clang 实现语法转换,解决大模型项目中的库映射与编译配置难题,助开发者高效完成代码移植,释放 AMD 显卡在大模型训练与推理中的高性价比潜力。

文章图片
#HIPify
SGLang 结构化输出实战,让大模型乖乖按 JSON 格式回答

本文详解 SGLang 框架如何利用约束解码技术实现大模型结构化输出,强制生成合规 JSON 格式。结合 AMD Instinct GPU 实战案例,展示从 Schema 定义到部署避坑的全流程,解决后端集成痛点,大幅提升 AI 应用稳定性与开发效率。

LM Studio 插件开发入门,扩展本地大模型的功能边界

本文详解 LM Studio 插件开发入门,助开发者扩展本地大模型功能边界。通过实战教程,演示如何利用 TypeScript 构建联网搜索与文件访问插件,打破模型知识截止限制,安全实现实时数据交互,打造个性化本地 AI 应用。

#LM Studio
AMD MI300X 对比 Nvidia H100,大模型推理成本与性能深度分析

本文深度对比 AMD MI300X 与 Nvidia H100 在大模型推理中的表现。针对 Llama 3.1 405B 的显存瓶颈,分析显示 MI300X 凭借大显存优势,单机即可部署 FP16 模型,显著降低硬件成本与通信延迟。文章从显存容量、精度博弈及每美元性能维度,论证了 MI3000X 在超大参数模型推理场景下的性价比优势。

AMD GPU 显存管理秘籍,避免大模型推理时的 OOM 崩溃

本文深入解析 AMD GPU 显存管理秘籍,重点剖析权重、激活值与 KV Cache 的消耗机制。通过落地 PagedAttention 技术、启用 FP8 量化及动态调度策略,有效避免大模型推理时的 OOM 崩溃,助力开发者在有限硬件上高效运行大规模模型。

Strix Halo 芯片跑本地大模型,Ollama 部署体验与性能测试

本文实测 AMD Strix Halo 芯片利用 Ollama 部署本地大模型的全流程。凭借 128GB 统一内存优势,成功运行 Llama 3 系列模型,并对比不同量化版本的性能与显存占用。文章提供 Linux 环境配置、散热优化及最佳实践,助力开发者打造高效隐私的移动端 AI 工作流。

#Strix Halo#Ollama
Radeon RX 7900 XTX 跑大模型,消费级显卡的极限在哪里

本文实测 Radeon RX 7900 XTX 运行大语言模型的极限性能。通过 INT4 量化技术,24GB 显存可流畅驱动 70B 参数模型。文章详解 Ollama 与 LM Studio 的 ROCm 部署优化及散热超频策略,为 DIY 爱好者提供高性价比的本地 AI 工作站搭建指南。

    共 104 条
  • 1
  • 2
  • 3
  • 11
  • 请选择