
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
【万字干货】一份完整的 DeepSeek AIOps 落地实施方案(含 K8s+vLLM 部署、RAG 核心代码、Ansible 自动化)
本文提供了一套完整、可落地的基于 DeepSeek 大模型的 AIOps 智能运维平台实施方案。内容涵盖技术架构设计、开源组件选型(vLLM、Milvus、Prometheus)、详细的 Kubernetes 部署脚本、RAG 知识库构建、日志和告警分析的核心 Python 代码示例,以及与 Ansible 的集成,旨在为希望在生产环境中实践 AIOps 的开发者和 SRE 工程师提供一份详尽的技

【深度实践】从0到1万卡GPU集群:Slurm部署架构演进与落地详解
摘要:本文提出分阶段构建大规模AIGPU集群的方案,从百卡验证到万卡超算逐步演进。百卡阶段采用单体架构验证技术栈;千卡阶段实现高可用架构,升级InfiniBand网络和并行存储;万卡阶段采用Slurm联邦架构,部署分层存储和智能运维体系。文章详细阐述了各阶段的架构设计、硬件选型和Slurm配置要点,为构建可扩展的AI算力底座提供实践指南。

[技术干货] Slurm vs. K8s全面对比及Ubuntu部署实践指南
摘要: 本文深入对比了Slurm和Kubernetes在高性能计算和云原生领域的应用差异。通过架构分析、功能对比和实际案例,揭示了两者在作业调度、资源管理等方面的核心差异:Slurm优化批处理作业吞吐量,Kubernetes则擅长微服务编排。文章还提供了在Ubuntu 22.04/24.04 LTS上部署两种集群的详细步骤,包括Slurm的MUNGE认证配置和Kubernetes的kubeadm初

到底了







