logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Ryzen AI 与 Radeon GPU 本地大模型实战效果全景

最近入手了一台搭载 AMD Strix Halo 架构的新本,最让我心动的不是它的游戏帧数,而是那块集成度极高的 Radeon 显卡所释放出的端侧 AI 算力。对于很多开发者来说,本地运行大语言模型(LLM)一直是个“痛并快乐着”的过程:云 API 虽然方便,但隐私顾虑和按量计费让人始终有所保留;而传统的本地部署往往受限于显存带宽,跑起来卡顿如 PPT。

#人工智能
Strix Halo 笔记本跑大模型,Ollama 和 LM Studio 谁更顺手

本文深度评测 AMD Strix Halo 笔记本运行大模型的表现,对比 Ollama 与 LM Studio 在 Windows 下的实战差异。依托 UMA 架构打破显存瓶颈,解析 Vulkan 后端优势及环境变量调优技巧,助开发者轻松实现高效本地推理。

#Strix Halo#Ollama
告别编译报错,用 Docker 在 Instinct GPU 上快速跑通 vLLM

本文详解如何利用 Docker 与 ROCm 7.x 官方镜像,在 AMD Instinct GPU 上快速部署 vLLM。通过一键拉取预构建容器,彻底告别繁琐的源码编译与环境配置地狱。文章涵盖 BF16 及 FP8 量化启动实战,并实测 MI300X 的高吞吐性能,助力开发者高效落地大模型推理服务。

文章图片
#vLLM
生产级大模型服务部署,vLLM 多卡并行与监控告警方案

本文详解生产级大模型服务部署方案,聚焦 vLLM 多卡并行优化与监控告警体系。通过 CPU 亲和性绑定提升通信效率,结合 DCGM、Prometheus 及 Grafana 构建全链路可观测性,有效解决长尾延迟与资源瓶颈,保障高并发场景下的大模型服务稳定运行。

#vLLM
别再手动编译了,用 Docker 在 Instinct GPU 上三分钟跑通 vLLM

本文详解如何利用 ROCm 7.x 官方 Docker 镜像,在 AMD Instinct GPU 上三分钟快速部署 vLLM。通过一键启动 Llama 3.1 模型并支持 BF16 与 FP8 量化,彻底告别手动编译地狱,实现开发到生产环境的一致性,大幅提升大模型推理效率。

#vLLM
Ollama 与 LM Studio 本地大模型部署实战指南

除了通用的温度和 Top P,深入调整模型参数能显著改变其行为。在 Ollama 的Modelfile中,你可以定义来扩展上下文窗口,让模型能记住更长的对话历史或处理更长的文档。但要注意,上下文越长,显存占用呈二次方增长,需量力而行。对于需要严格格式输出的场景(如提取 JSON 数据),可以在系统提示词中强约束,或者调整(重复惩罚)参数,防止模型陷入死循环重复某句话。在 LM Studio 中,还

#人工智能
从源码编译到服务上线,AMD 显卡跑大模型的完整避坑清单

本文详解 AMD 显卡运行大模型的完整避坑指南,涵盖从源码编译到服务上线的关键步骤。针对 HIP 库缺失、Triton 版本冲突及算子不支持等常见报错,提供精准修复方案与环境配置建议,助开发者高效部署 ROCm 生态下的 AI 应用。

手把手教你用 Docker 封装 ROCm 推理环境,一次构建到处运行

本文详解如何利用 Docker 封装 ROCm 推理环境,解决 AMD GPU 部署中的依赖难题。通过编写生产级 Dockerfile 及配置关键启动参数,实现 vLLM 在 DevCloud 或本地的一次构建、到处运行,大幅提升大模型推理服务的部署效率与稳定性。

#vLLM
DevCloud 新手必看,如何正确选型实例以支撑大模型推理

本文详解 DevCloud 大模型推理实例选型策略,打破唯显存论误区。重点解析 CPU 与内存的黄金比例及 RDMA 高速互联对 vLLM 性能的关键影响,提供高性价比配置方案,助开发者优化资源支撑高效推理。

#vLLM
LLaMA-Factory 微调大模型在 ROCm 环境的配置指南

本文详解 LLaMA-Factory 在 ROCm 环境的配置指南,涵盖依赖替换、环境变量设置及混合精度调优。通过实战案例解决训练发散问题,助科研人员在 AMD GPU 上高效完成大模型微调,实现稳定收敛。

#LLaMA-Factory
    共 170 条
  • 1
  • 2
  • 3
  • 17
  • 请选择