logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【DGX Spark 实战】部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0 兼容版)-修订

本文详细记录在 NVIDIA DGX Spark(Grace Blackwell 架构)上部署 vLLM 推理服务并接入 Open WebUI 的完整流程,包含 FlashAttention 编译、vLLM wheel 安装、Qwen3-Coder-Next-FP8 模型加载等关键步骤,适配 aarch64 + CUDA 13.0 环境,所有命令经实测验证,可直接用于生产部署

文章图片
#spark#大数据
【DGX Spark 实战】部署SGLang,千问3.5-27B模型初探

部署SGLang推理引擎,加载千问3.5-57B模型

文章图片
#spark#sglang
【DGX Spark 实战】面向 128GB 统一内存的DeepSeek-V4 流式推理引擎设计及实现

本文详细介绍了如何在 128GB 统一内存的 DGX Spark(GB10) 单卡上运行 284B 参数、158GB 权重的 DeepSeek-V4-Flash模型,核心思路是利用 MoE 架构稀疏激活特性,仅按需加载激活的专家权重。

文章图片
#人工智能#自然语言处理
【DGX Spark 实战】部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0 兼容版)-修订

本文详细记录在 NVIDIA DGX Spark(Grace Blackwell 架构)上部署 vLLM 推理服务并接入 Open WebUI 的完整流程,包含 FlashAttention 编译、vLLM wheel 安装、Qwen3-Coder-Next-FP8 模型加载等关键步骤,适配 aarch64 + CUDA 13.0 环境,所有命令经实测验证,可直接用于生产部署

文章图片
#spark#大数据
【DGX Spark 实战】部署SGLang,千问3.5-27B模型初探

部署SGLang推理引擎,加载千问3.5-57B模型

文章图片
#spark#sglang
【Qwen Code】自定义模型配置指南,支持https自签名证书访问

本文档介绍如何在 Qwen Code 中配置自定义模型,特别是连接使用自签名证书的私有 API 端点(如 vLLM 部署的模型服务)。

文章图片
#node.js
【DGX Spark 实战】面向 128GB 统一内存的DeepSeek-V4 流式推理引擎设计及实现

本文详细介绍了如何在 128GB 统一内存的 DGX Spark(GB10) 单卡上运行 284B 参数、158GB 权重的 DeepSeek-V4-Flash模型,核心思路是利用 MoE 架构稀疏激活特性,仅按需加载激活的专家权重。

文章图片
#人工智能#自然语言处理
【DGX Spark 实战】面向 128GB 统一内存的DeepSeek-V4 流式推理引擎设计及实现

本文详细介绍了如何在 128GB 统一内存的 DGX Spark(GB10) 单卡上运行 284B 参数、158GB 权重的 DeepSeek-V4-Flash模型,核心思路是利用 MoE 架构稀疏激活特性,仅按需加载激活的专家权重。

文章图片
#人工智能#自然语言处理
    共 11 条
  • 1
  • 2
  • 请选择