logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

vllm拉起MinerU2.5-2509-1.2B及请求示例

VLLM拉起MinerU2.5-2509-1.2B模型及请求示例

#人工智能#python
DeepSeek-V4-Flash × 昇腾910B PD分离深度分析:模型切分、权重分布与显存占用全揭秘

本文基于华为昇腾Atlas 800I A2(910B 64GB)×8台服务器,使用vLLM-Ascend推理引擎 + Mooncake KV Cache传输框架,对DeepSeek-V4-Flash(284B参数/13B激活/MoE)进行 Prefill-Decode(PD)分离部署的模型切分机制进行全方位深度剖析

#人工智能#python
DeepSeek-V4-Flash × 昇腾910B PD分离深度分析:模型切分、权重分布与显存占用全揭秘

本文基于华为昇腾Atlas 800I A2(910B 64GB)×8台服务器,使用vLLM-Ascend推理引擎 + Mooncake KV Cache传输框架,对DeepSeek-V4-Flash(284B参数/13B激活/MoE)进行 Prefill-Decode(PD)分离部署的模型切分机制进行全方位深度剖析

#人工智能#python
Ubuntu24.04版本部署docker

基于ubuntu24.04 部署docker 服务

#docker#容器#运维
dify升级全流程

本篇讲述dify 升级全流程操作,涉及到数据备份和还原等操作

文章图片
#人工智能#linux
    共 18 条
  • 1
  • 2
  • 请选择