logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

统信UOS V2500 环境下K8S 环境部署

本文详细记录了Kubernetes集群的部署过程,文档提供了完整的命令序列和注意事项,特别强调了网络配置一致性、镜像源替换等关键点,确保集群部署顺利进行。所有操作均包含验证步骤,保证各环节配置正确生效。

文章图片
#kubernetes#容器#云原生
AI 大模型私有化部署:模型选择与资源规划指南

本文档提供了AI大模型私有化部署的完整指南,重点从资源需求测算、模型选型方法和部署实操三个维度展开。首先详细介绍了不同精度类型(INT4/INT8/FP16等)下模型参数与硬件资源(显存/内存/CPU)的对应关系,并给出推荐配置表。其次提出模型选型方法论,建议根据业务场景匹配参数规模和精度类型。最后以魔塔社区为例,给出模型下载和部署的具体操作步骤。文档强调"先算资源再选模型"的

#人工智能#大数据
统信 UOS + 沐曦 C500 容器化部署 vLLM 推理完整实操手册

本文介绍了在UOS V25服务器操作系统上部署沐曦AI加速卡(C500)的vLLM推理服务的完整流程。环境配置包括驱动(3.7.2.30)和SDK(3.7.2.0)安装,提供两种架构的Docker镜像拉取方式(x86/aarch64)。通过详细的docker run命令实现容器化部署,重点配置了GPU内存、并行计算等参数。服务启动后,通过curl发送测试请求验证功能,成功获取模型(DeepSeek

#AI
统信 UOS + 沐曦 C500 容器化部署 SGLang 推理完整实操手册

本文介绍了在UOS V25服务器操作系统上部署沐曦C500加速卡AI推理服务的完整流程。环境配置包括浪潮AI服务器、沐曦驱动3.7.2.30和SDK 3.7.2.0。通过Docker容器化部署,使用uos-server-25-metax-sglang镜像,配置大内存和设备权限后启动服务。在容器内运行sglang.launch_server启动32B参数的DeepSeek-R1模型推理服务,开放91

UOS V2500 沐曦mx-exporter监控加速卡(非K8S)

本文介绍了在UOS V25服务器操作系统上部署沐曦AI加速卡(C500)监控系统的完整流程。

#prometheus
统信UOS+海光dcu-exporter监控加速卡(非K8S)

本文详细介绍了在UOS V25服务器操作系统上部署海光K100_AI加速卡监控系统的完整流程。内容包括基础环境配置(驱动、DTK SDK安装)、dcu-exporter部署、Prometheus容器化配置以及Grafana仪表盘导入。通过ROCm驱动安装验证、dcu-exporter服务启动、Prometheus数据抓取配置等步骤,最终实现在Grafana中可视化监控DCU加速卡状态。文档提供了各

#kubernetes#容器#云原生
统信UOS下天数智芯ix-exporter监控加速卡(非K8S)

本文介绍了在UOS V25服务器操作系统上部署天数智芯AI加速卡监控系统的完整方案。内容包括:基础环境配置(操作系统、服务器型号、驱动版本等)、天数智芯驱动安装指南、ix-exporter容器化部署步骤(镜像拉取、容器启动及验证)、Prometheus监控配置(针对vLLM和SGLang服务的指标采集)与容器化部署方法,以及Grafana可视化平台的容器化部署、数据源配置和定制仪表盘导入流程。文档

#kubernetes#容器#云原生
统信UOS 系统AISBench大模型评测工具使用手册

本文介绍了在UOS V2500系统下使用AISBench工具对vLLM服务进行大模型评测的完整流程。内容涵盖环境配置(服务器、Python版本、模型等)、AISBench工具功能(精度和性能测评)、安装步骤、数据集准备(以gsm8k为例)、vLLM服务部署,以及快速使用指南,包括单任务测试和精度测试方法。AISBench作为国产信创主流评测工具,支持多种测评场景,通过简单命令即可完成模型性能评估,

大模型落地三大核心技术:蒸馏、RAG与微调的原理、优劣及场景适配

本文系统分析了大模型落地的三大优化技术:模型蒸馏、RAG检索增强生成和模型微调。模型蒸馏通过知识迁移实现轻量化部署,适用于资源受限场景;RAG通过外部知识检索增强生成,解决知识时效性问题;模型微调通过领域数据训练实现专业化定制。三者各有优劣:蒸馏轻量但能力受限,RAG知识动态但依赖数据质量,微调精准但需专业数据。技术选择需结合场景需求,资源受限选蒸馏,知识更新快选RAG,专业领域选微调,也可组合使

#大数据#人工智能#算法 +1
统信UOS环境+英伟达CUDA异构平台下SGLang部署手册

本文介绍了在统信UOS V2500系统上部署SGLang服务的两种方法:物理机部署和容器化部署。硬件环境采用浪潮服务器和NVIDIA A100显卡,软件使用SGLang 0.5.4和DeepSeek-R1-Distill-Qwen-1.5B模型。物理机部署包括CUDA环境配置、Python虚拟环境搭建和SGLang服务启动;容器化部署则通过Docker实现,提供了详细的docker-compose

#sglang#CANN
    共 47 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择