
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
vllm拉起MinerU2.5-2509-1.2B及请求示例
VLLM拉起MinerU2.5-2509-1.2B模型及请求示例
DeepSeek-V4-Flash × 昇腾910B PD分离深度分析:模型切分、权重分布与显存占用全揭秘
本文基于华为昇腾Atlas 800I A2(910B 64GB)×8台服务器,使用vLLM-Ascend推理引擎 + Mooncake KV Cache传输框架,对DeepSeek-V4-Flash(284B参数/13B激活/MoE)进行 Prefill-Decode(PD)分离部署的模型切分机制进行全方位深度剖析
DeepSeek-V4-Flash × 昇腾910B PD分离深度分析:模型切分、权重分布与显存占用全揭秘
本文基于华为昇腾Atlas 800I A2(910B 64GB)×8台服务器,使用vLLM-Ascend推理引擎 + Mooncake KV Cache传输框架,对DeepSeek-V4-Flash(284B参数/13B激活/MoE)进行 Prefill-Decode(PD)分离部署的模型切分机制进行全方位深度剖析
Ubuntu24.04版本部署docker
基于ubuntu24.04 部署docker 服务
vllm bench serve 压测大模型DeepSeek-V3.2或其他系列模型(脚本也支持)
vllm bench serve 压测大模型,方便了解各个模型性能。
vllm bench serve 压测大模型DeepSeek-V3.2或其他系列模型(脚本也支持)
vllm bench serve 压测大模型,方便了解各个模型性能。
全流程部署Qwen3-Rerank-8B嵌入模型(dify和ragflow 都可支持添加到rerank 模型)
全流程部署Qwen3-Rerank-8B重排序模型

华为昇腾910B拉起MinerU2.5-Pro-2605-1.2B示例
昇腾910B拉起模型MinerU2.5-Pro-2605-1.2B
华为昇腾910B拉起MinerU2.5-Pro-2605-1.2B示例
昇腾910B拉起模型MinerU2.5-Pro-2605-1.2B








