logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

AMD 显卡跑大模型,DevCloud 上 ROCm 7.x 环境搭建避坑指南

本文详解在 DevCloud 上搭建 AMD 显卡 ROCm 7.x 环境,成功运行大模型的全流程。涵盖权限配置、PyTorch 源码编译及 vLLM 部署避坑指南,助开发者解决驱动识别与显存溢出难题,高效实现 Llama 3 流式推理。

#vLLM
AMD Instinct GPU 与 ROCm 7.x 大模型推理实战效果全景

在构建高性能 AI 推理服务的过程中,开发者常常面临硬件选型迷茫与软件栈适配复杂的双重挑战。尤其是当项目从单卡验证走向多卡集群部署时,如何确保算力线性增长、显存高效利用以及框架无缝迁移,直接决定了业务落地的成败。许多团队在引入新型加速卡时,往往耗费大量时间在环境配置和算子兼容性调试上,却忽略了架构层面的核心参数与软件特性的深度结合。对于专注于大模型落地的一线工程师而言,理解底层硬件的算力构成与上层

#服务器#网络#大数据
Strix Halo 实战,让本地大模型真正长出执行手脚

本文详解如何利用 Strix Halo 架构的超大内存优势,结合 Vulkan 后端与 OpenClaw 框架,打造高效本地 Agent。通过配置 128k 上下文窗口及优化量化模型,解决长文档处理痛点,实现安全、隐私可控的自动化工作流,让大模型真正具备本地执行力。

#Strix Halo
AMD 显卡跑大模型,ROCm 7.x 加 vLLM 的避坑实录

本文详解 AMD 显卡部署大模型实战,聚焦 ROCm 7.x 与 vLLM 的避坑指南。涵盖 Ubuntu 环境配置、PyTorch 源码编译及显存碎片化调优,通过调整 block-size 与 FP8 量化解决 OOM 难题,助开发者高效构建稳定推理服务。

#vLLM
Windows 跑大模型别死磕 ROCm,Vulkan 才是 AMD 显卡的稳赢解

本文详解 Windows 下 AMD 显卡运行大模型的最优解:放弃不稳定的 ROCm,转而使用 Vulkan 后端。通过 LM Studio 配置 Vulkan 加速与 128k 长上下文,结合 Strix Halo 统一内存优势,实现推理速度提升 8 倍及静音体验,是本地 AI 部署的高效方案。

Ollama 还是 LM Studio,AMD Strix Halo 主机部署大模型怎么选

本文深度解析 AMD Strix Halo 主机部署大模型的最佳方案,对比 Ollama 与 LM Studio。针对 OpenClaw 框架需求,推荐 LM Studio 搭配 Vulkan 后端,充分利用 128GB 统一内存优势,实现本地 AI 高效运行与长上下文处理,打造私有化智能工作站。

#LM Studio
从 CUDA 到 ROCm,用 HIPify 和 SGLang 跑通大模型迁移第一步

本文详解从 CUDA 到 ROCm 的大模型迁移实战。通过 HIPify 工具自动化转换代码,结合 SGLang 框架优化推理性能,解决依赖冲突与编译报错。助开发者在 AMD GPU 上高效部署大模型,实现低成本异构计算。

#HIPify
解锁 128k 长上下文,Strix Halo 让本地大模型读懂整本技术书

本文详解 AMD Strix Halo 如何突破显存瓶颈,在本地轻松运行 128k 长上下文大模型。通过 LM Studio 配置 Vulkan 后端,用户可一次性投喂整本技术书或代码库,实现精准细节引用与跨段落逻辑推理,彻底解决隐私泄露焦虑,重塑本地 AI 生产力。

#Strix Halo
AMD Instinct GPU 跑大模型,DevCloud 环境搭建避坑实录

本文详解在 DevCloud 搭建 AMD Instinct GPU 环境跑大模型的避坑指南。涵盖权限配置、ROCm 驱动验证及 PyTorch 源码编译关键步骤,重点解析架构代码匹配与 vLLM 部署技巧,助开发者高效构建稳定推理环境。

#vLLM
本地大模型代码辅助实战,Strix Halo 重构老旧项目实录

本文实战演示利用 AMD Strix Halo 架构笔记本,本地部署 14B 大模型重构老旧 Java 代码。通过统一内存优势实现高效推理,在确保核心代码不出域的前提下,精准识别安全隐患并生成现代化重构方案,为高敏场景提供安全高效的本地代码辅助新范式。

#Strix Halo
    共 109 条
  • 1
  • 2
  • 3
  • 11
  • 请选择