logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

深入解析 ROCm 7.x 新特性,看它如何加速大模型推理

本文深入解析 ROCm 7.x 新特性,揭示其如何通过 hipBLASLt 稀疏优化、HIP 编译器指令调度及 vLLM 异步执行流,显著提升大模型推理效率。实测显示长上下文场景延迟降低 20%,为高并发应用提供稳定高性能支持。

SGLang 加速大模型推理的入门配置指南

摘要: SGLang通过RadixAttention和连续批处理技术优化大语言模型本地部署的显存管理,显著提升推理效率。安装时需注意CUDA版本匹配,推荐使用pip install "sglang[all]"。加载LLaMA-3-8B模型后,通过调整--mem-fraction-static等参数可平衡显存与吞吐量。测试显示,SGLang在并发请求下吞吐量可达传统方式的2-3倍,尤其适合消费级显卡

Strix Halo 笔记本无独显运行 72B 大模型实战指南

本文详解 Strix Halo 笔记本无独显运行 72B 大模型实战指南。通过配置 ROCm 6.4 驱动与优化 vLLM 参数,结合 XDNA2 NPU 异构加速,突破 32GB 内存限制,实现高效本地推理,为边缘 AI 应用提供全新范式。

#Strix Halo#vLLM
多卡并行推理实战,利用 Instinct GPU 提升大模型吞吐量

本文详解基于 AMD Instinct GPU 的多卡并行推理实战。通过优化张量并行配置、检查硬件拓扑、实施 NUMA 进程绑核及调优 RCCL 通信后端,有效打破显存墙并提升大模型吞吐量。文章提供基准测试方法,助力企业实现线性加速比,最大化集群算力效率。

本地大模型三剑客 llama.cpp Ollama LM Studio 分工解析

本文深度解析本地大模型三剑客:llama.cpp、Ollama 与 LM Studio。文章阐明三者分别承担底层推理引擎、API 服务封装及可视化交互终端的核心分工,帮助开发者构建高效协同的本地 AI 基础设施,优化模型部署与工作流。

#Ollama#LM Studio
LM Studio 图形化部署大模型的常见报错与解决方案

本文解析 LM Studio 图形化部署大模型的常见报错,重点解决 GGUF 格式不匹配及显存溢出问题。通过调整量化等级、优化上下文窗口及排查驱动冲突,帮助用户快速掌握本地大模型部署技巧,实现高效稳定的 AI 推理体验。

#LM Studio
基于 Github 开源项目构建本地私有化大模型知识库

本文详解基于 Github 开源项目构建本地私有化大模型知识库的全流程。通过 LLaMA-Factory 微调、llama.cpp 量化及 Ollama 服务化,打造零依赖的本地私有知识库方案,确保数据不出域且支持多硬件高效推理,实现安全可控的企业级 AI 应用。

利用 vLLM 在 Radeon GPU 上搭建本地大模型助手

本文详解如何利用 vLLM 在 Radeon GPU 上搭建本地大模型助手。通过对比 Ollama 与 vLLM,深入 Strix Halo 架构下的显存优化与低功耗设置,提供部署 Llama 3 及 OpenAI 兼容接口的实战指南,助开发者构建安全高效的私有 AI 推理服务。

#vLLM#Radeon GPU
DevCloud 容器化部署 vLLM 的网络与存储优化

本文详解 DevCloud 环境下 vLLM 容器化部署的网络与存储优化策略。针对 ROCm 硬件映射难题,提出设备节点映射与共享内存调优方案;结合 NFS 参数调整及本地缓存加速,显著提升大模型推理启动速度与稳定性,助力实现云原生高可用部署。

#vLLM
Strix Halo 架构下运行大模型的能效比分析

本文深入分析 Strix Halo 架构在运行大语言模型时的能效表现。凭借统一内存设计突破显存瓶颈,结合功耗优化与散热策略,显著提升本地推理速度。文章探讨软硬协同生态,展示其在边缘侧 AI 应用的独特优势。

#Strix Halo
    共 143 条
  • 1
  • 2
  • 3
  • 15
  • 请选择