logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

把笔记本变工作站,Strix Halo 运行多 Agent 协作的真实记录

本文记录基于 AMD Strix Halo 架构笔记本构建本地多 Agent 协作环境的实战。利用统一内存架构突破显存限制,通过 Ollama 多实例部署与 Python 任务编排,实现规划、编码、审查的高效协同,验证了端侧 AI 工作流的可行性与稳定性。

Strix Halo 笔记本跑大模型,Ollama 和 LM Studio 到底选哪个

本文深度解析 AMD Strix Halo 笔记本运行大模型的最佳实践,对比 Ollama 与 LM Studio 在 Vulkan 后端下的性能差异。通过优化量化等级与上下文参数,解决 GPU 利用率低的问题,助开发者打造高效隐私安全的本地 AI 工作站。

#Strix Halo#Ollama
Ryzen AI 笔记本跑通本地 Agent,Ollama 配置避坑实录

本文详解如何在 Ryzen AI 笔记本上利用 Vulkan 后端与 LM Studio 部署本地 Agent。通过配置超大上下文窗口及 OpenClaw 框架,实现数据不出域的私有化 AI 工作流,解决 GPU 调度难题,为开发者提供安全高效的本地大模型应用方案。

本地 AI 不卡顿,Ryzen AI 配合 Vulkan 后端的调优笔记

本文详解 Ryzen AI Max+笔记本运行本地大模型的调优技巧。通过强制切换 Vulkan 后端及设置 HSA_OVERRIDE_GFX_VERSION 环境变量,解决 GPU 利用率低和推理卡顿问题。结合模型量化与显存管理策略,助您在 Windows 环境下流畅部署 70B 大模型,释放 Strix Halo 架构满血性能。

Strix Halo 实战指南,让本地大模型真正长出手脚

本文详解 Strix Halo 实战指南,利用 Vulkan 后端与超大上下文窗口,结合 Ollama 和 OpenClaw 框架打造本地 AI 代理。通过优化配置解决长文档处理痛点,实现安全高效的自动化工作流,让大模型真正具备执行力。

#Strix Halo
从 110 到 155 tokens/s,我的 MI300X 推理加速实录

本文实录 AMD MI300X 推理加速过程,通过 ROCm 7.x 生态将精度从 BF16 切换至 FP8,利用 vLLM 优化显存占用与带宽效率。实测吞吐量从 110 tokens/s 跃升至 155 tokens/s,为开发者提供大模型低成本高性能部署方案。

新手也能懂,手把手教你在 AMD 显卡上部署量化大模型

本文手把手教你在 AMD 显卡上部署量化大模型。通过 Docker 容器化方案与 vLLM 框架,利用 FP8 量化技术实现一键加速,显存占用减半且吞吐量提升超 40%。教程涵盖环境配置、实战命令及避坑指南,助新手轻松驾驭 AMD ROCm 生态,高性价比运行大模型。

ROCm 7.x 实战手记:如何把 Llama 3.1 推理速度再提四成

本文详解在 ROCm 7.x 环境下,利用 FP8 量化技术优化 Llama 3.1 推理性能。通过 vLLM 框架切换精度,有效突破显存带宽瓶颈,使 MI300X 显卡推理速度提升超 40%,并显著增强长上下文处理的稳定性与并发能力。

告别显存焦虑,我在 DevCloud 上跑通 vLLM FP8 全流程

本文详解如何在 DevCloud 利用 ROCm 7.x 与 vLLM 实现 FP8 量化,解决大模型推理显存焦虑。通过动态量化技术,Llama-3.1-8B 模型显存占用减半,吞吐量提升超 40%,有效避免 OOM 并大幅降低延迟,为高并发场景提供高效解决方案。

#vLLM
别只跑 BF16 了,我在 MI300X 上用一行命令开启 FP8 量化

本文详解在 AMD MI300X 上利用 ROCm 7.x 与 vLLM,通过一行命令开启 FP8 量化。实测显示,相比 BF16,FP8 模式显存占用降低 40%,吞吐量提升超 40%,有效解决大模型长上下文并发瓶颈,是降本增效的关键实践。

#vLLM
    共 111 条
  • 1
  • 2
  • 3
  • 12
  • 请选择