logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

SGlang+DFlash2 加速Qwen3.8-27B 4~5倍性能!!!

本文记录一次内部 8 卡 RTX 3090 服务器上的可复跑对比测试。比较对象为同一份 Qwen3.8-27B 主模型权重:一侧使用 vLLM,另一侧使用 SGLang + DFlash2 投机解码。本文仅描述测试环境、方法和结果,不包含服务器地址、账号、密钥或业务数据。

#sglang#github
炸裂!仅需6万块硬件成本,实现 DeepSeek-V4 级大模型 Token 自由!

摘要: 8张二手RTX 3090(192GB显存)通过GGUF/MXFP4量化模型部署DeepSeek-V4-Flash-0731,实测首字延迟680ms,生成速度39 tokens/s,可流畅处理复杂代码生成任务。硬件成本约6.5-6.9万元,但需考虑高功耗(3kW级)、散热及二手卡稳定性问题。该方案适合数据敏感场景,提供本地化、可控的API服务,但需配套监控和容灾措施。模型支持1M上下文,当前

文章图片
#DeepSeek
炸裂!仅需6万块硬件成本,实现 DeepSeek-V4 级大模型 Token 自由!

摘要: 8张二手RTX 3090(192GB显存)通过GGUF/MXFP4量化模型部署DeepSeek-V4-Flash-0731,实测首字延迟680ms,生成速度39 tokens/s,可流畅处理复杂代码生成任务。硬件成本约6.5-6.9万元,但需考虑高功耗(3kW级)、散热及二手卡稳定性问题。该方案适合数据敏感场景,提供本地化、可控的API服务,但需配套监控和容灾措施。模型支持1M上下文,当前

文章图片
#DeepSeek
DeepSeek-V4-Pro 部署实战指南:H100/H200/B200/B300/GB200/GB300 全硬件配置详解

DeepSeek-V4-Pro 是 DeepSeek 的旗舰 MoE 模型,拥有 1.6T 总参数和 49B 激活参数,支持 1M 上下文长度。官方提供了基于 vLLM 的六种 GPU 部署方案,包括 H200、B200、GB200 NVL4、B300 和 GB300 NVL4 等配置。部署采用 Docker 镜像(CUDA 12.9/13),支持 FP4/FP8 混合精度,并针对不同硬件优化了并

文章图片
#自然语言处理#gru#transformer
DeepSeek-V4-Pro 部署实战指南:H100/H200/B200/B300/GB200/GB300 全硬件配置详解

DeepSeek-V4-Pro 是 DeepSeek 的旗舰 MoE 模型,拥有 1.6T 总参数和 49B 激活参数,支持 1M 上下文长度。官方提供了基于 vLLM 的六种 GPU 部署方案,包括 H200、B200、GB200 NVL4、B300 和 GB300 NVL4 等配置。部署采用 Docker 镜像(CUDA 12.9/13),支持 FP4/FP8 混合精度,并针对不同硬件优化了并

文章图片
#自然语言处理#gru#transformer
DeepSeek 也能看图了?我们给企业 AI 中台的 Flash 0731 装上了一双“眼睛”

本文介绍了企业如何通过AI中台为DeepSeek文本模型增加视觉理解能力。DeepSeek主聊天模型本身不支持直接解析图片,需要额外构建视觉识别链路。解决方案采用"OCR/视觉模型预处理+DeepSeek分析"的架构,通过中台先识别图片内容(文字、物体、场景等),再转换为结构化信息供DeepSeek推理。这种组合方式既保留了DeepSeek强大的文本处理能力,又实现了系统级多模态体验,同时具备模块

文章图片
#人工智能
从一条 DOWN 告警到 GPFS 租约重获:我们提前抓住了一次 IB 链路隐患

摘要: IBNetVision成功捕捉到一条InfiniBand链路的短暂抖动(持续十几秒后自动恢复),并通过多维度证据链锁定故障点:1)监控系统发现同一链路连续DOWN状态并精确定位至交换机端口与节点HCA;2)GPFS日志显示RDMA端口错误引发文件系统租约失效与恢复;3)操作系统内核日志同步记录链路异常。本地AI知识库辅助工程师快速关联跨层日志,整理排查顺序。该案例凸显了短暂但反复的链路抖动

文章图片
#人工智能#运维
DeepSeek-V4-Pro 部署实战指南:H100/H200/B200/B300/GB200/GB300 全硬件配置详解

DeepSeek-V4-Pro 是 DeepSeek 的旗舰 MoE 模型,拥有 1.6T 总参数和 49B 激活参数,支持 1M 上下文长度。官方提供了基于 vLLM 的六种 GPU 部署方案,包括 H200、B200、GB200 NVL4、B300 和 GB300 NVL4 等配置。部署采用 Docker 镜像(CUDA 12.9/13),支持 FP4/FP8 混合精度,并针对不同硬件优化了并

#自然语言处理#gru#transformer
SlurmInsight:让 Slurm 集群管理告别终端!

还在用 scontrol 和 sinfo 手动查集群状态?SlurmInsight 是一款专为 Slurm 调度系统打造的 Web 可视化监控平台。从仪表盘到节点热图,从作业队列到历史趋势,让 HPC 集群管理像看仪表盘一样简单。即将开源,敬请关注!

文章图片
#HPC
LustreOps:让 Lustre 集群运维从黑屏走向可视化

还在终端里敲 lfs df 查状态?认识 LustreOps——一款专为 Lustre 文件系统打造的开源运维监控平台。从集群仪表盘到 AI 智能诊断,让海量存储运维像看仪表盘一样简单。

文章图片
#运维
到底了