
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文对比测试了vLLM-CPU和llama.cpp在纯CPU环境下运行大模型的性能表现。测试环境使用4vCPU+16GB内存的服务器,分别部署MiniCPM5-1B模型进行验证。

随着大模型应用规模持续扩张,如何在有限算力条件下提升推理效率,已成为建设的核心课题。致力于,实现。在这一背景下,GPUStack 与合作,为开发者提供了一个。本届汇聚来自不同背景的开发者,他们将在这一平台上围绕大模型推理性能展开深入探索,通过工程实践不断突破现有系统在性能与效率上的边界。参赛者将以为基础,针对全球首个混合注意力架构模型进行深度性能攻关。在真实模型与推理框架环境中,通过对关键算子实现

本文由 GPUStack 社区用户实测分享整理。GLM-5.2-FP8-DSpark 是在 GLM-5.2-FP8 基础上,通过挂载 RedHatAI 提供的外置草稿模型(Speculator)做投机解码(Speculative Decoding)的增强方案——同一份主模型权重,额外加载一个草稿模型,用来提升解码吞吐。社区用户在模型放出当天(Day 0)就在 8 卡 H20-141G 环境上,通过

本文介绍了在AI Max 395设备上部署OpenBMB开源智能体模型AgentCPM的全流程。文章首先介绍了4B参数的AgentCPM-Explore和8B参数的AgentCPM-Report两款模型的特点与性能优势,包括在多个基准测试中超越闭源模型的表现。随后详细讲解了在搭载AMD Strix Halo处理器的零刻GTR9 Pro上,通过Ubuntu系统配置ROCm环境、优化显存分配的具体步骤

本文实测 GPUStack 在 H20 与昇腾 910B 上部署 DeepSeek-V4-Flash-0731,解析 DSpark 加速、长上下文性能及生产配置建议。

本文基于 Qwen3.5 在 H100/H200 上的实测,分析 vLLM performance-mode 的实际作用。结果表明,它并非独立提速手段,而是结合量化、cache 等优化,用于收敛低延迟或高吞吐目标,主要价值在于缩小调优范围。

在昇腾 910B 环境部署 DeepSeek-V4 的实践教程。

本文基于 Qwen3.5 在 H100/H200 上的实测,分析 vLLM performance-mode 的实际作用。结果表明,它并非独立提速手段,而是结合量化、cache 等优化,用于收敛低延迟或高吞吐目标,主要价值在于缩小调优范围。

本文实测 GPUStack 在 H20 与昇腾 910B 上部署 DeepSeek-V4-Flash-0731,解析 DSpark 加速、长上下文性能及生产配置建议。

本文实测 GPUStack 在 H20 与昇腾 910B 上部署 DeepSeek-V4-Flash-0731,解析 DSpark 加速、长上下文性能及生产配置建议。








