logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

单节点 Kubernetes 部署 HAMi,并基于 8G 显卡测试 vGPU 切分

本文详细介绍了在单节点Kubernetes集群中使用HAMi实现NVIDIA GPU共享的完整流程。主要内容包括:部署前的环境检查(NVIDIA驱动和容器运行时配置)、HAMi的Helm安装方法、关键组件验证,以及多个核心功能的测试验证:显存切分(固定值和百分比)、GPU算力比例限制、设备型号/UUID指定等。重点澄清了nvidia.com/gpu资源的误解,指出该字段表示申请的GPU设备实例数而

HAMi + Volcano 联合测试:在单节点 Kubernetes 上使用 RTX 3070 Ti 验证 vGPU 与 Gang Scheduling

本文记录了在Kubernetes单节点集群(配备NVIDIA RTX 3070Ti显卡)上测试VolcanovGPU与HAMi-core实现GPU共享调度的过程。测试验证了四个核心场景:1)单Pod成功申请vGPU资源(2000Mi显存/30%核心);2)VolcanoJob通过minAvailable实现GangScheduling,确保两个worker同时调度;3)资源不足时PodGroup保

Kubernetes 中部署 NVIDIA GPU Operator,并接入 Prometheus + Grafana 监控 GPU 指标

本文介绍了在Kubernetes集群中部署NVIDIA GPU Operator的完整流程。主要内容包括:1. 环境准备(Kubernetes 1.35.5、NVIDIA RTX 3070Ti显卡、containerd运行时);2. 通过Helm部署GPU Operator并配置相关参数,包括禁用自动安装驱动(driver.enabled=false)和启用DCGM Exporter;3. 验证G

Kubernetes Gateway API 入门: Ingress 的下一代方案

在 Kubernetes 里,服务暴露通常会经历下面几个阶段。最开始,我们可能会用NodePort后来为了支持域名、路径转发、HTTPS 等能力,开始使用Ingress但是随着 Kubernetes 使用场景越来越复杂,尤其是在多团队、多命名空间、灰度发布、Header 匹配、流量权重、跨命名空间路由等场景下,Ingress 的表达能力开始显得不够。Gateway API 就是在这个背景下出现的。

Gateway API 实战:在单节点 Kubernetes 上使用 Envoy Gateway 跑通 HTTPRoute、Header 匹配和金丝雀分流

原因是本文是单节点测试集群,没有云厂商 LoadBalancer,也没有安装 MetalLB,所以 Envoy Gateway 创建出来的 LoadBalancer Service 没有获得外部 IP。这不是 Gateway YAML 写错。Envoy 数据面 Pod Running本文在单节点 Kubernetes 测试环境中完成了 Envoy Gateway 和 Gateway API 的基础

#gateway#kubernetes
Kubernetes 监控实战:使用 Alertmanager 实现邮件告警、分组路由与告警抑制

PrometheusRule 判断告警↓告警经过 PENDING 后进入 FIRING↓Prometheus 将告警发送给 Alertmanager↓Alertmanager 按 namespace 和 alertname 分组↓根据 alertname 和 notify_group 匹配路由↓critical 抑制同名 warning 和 info 通知↓通过 QQ SMTP 发送告警与恢复邮件

#prometheus
单节点 Kubernetes 部署 HAMi,并基于 8G 显卡测试 vGPU 切分

本文详细介绍了在单节点Kubernetes集群中使用HAMi实现NVIDIA GPU共享的完整流程。主要内容包括:部署前的环境检查(NVIDIA驱动和容器运行时配置)、HAMi的Helm安装方法、关键组件验证,以及多个核心功能的测试验证:显存切分(固定值和百分比)、GPU算力比例限制、设备型号/UUID指定等。重点澄清了nvidia.com/gpu资源的误解,指出该字段表示申请的GPU设备实例数而

HAMi + Volcano 联合测试:在单节点 Kubernetes 上使用 RTX 3070 Ti 验证 vGPU 与 Gang Scheduling

本文记录了在Kubernetes单节点集群(配备NVIDIA RTX 3070Ti显卡)上测试VolcanovGPU与HAMi-core实现GPU共享调度的过程。测试验证了四个核心场景:1)单Pod成功申请vGPU资源(2000Mi显存/30%核心);2)VolcanoJob通过minAvailable实现GangScheduling,确保两个worker同时调度;3)资源不足时PodGroup保

Gateway API 实战:在单节点 Kubernetes 上使用 Envoy Gateway 跑通 HTTPRoute、Header 匹配和金丝雀分流

原因是本文是单节点测试集群,没有云厂商 LoadBalancer,也没有安装 MetalLB,所以 Envoy Gateway 创建出来的 LoadBalancer Service 没有获得外部 IP。这不是 Gateway YAML 写错。Envoy 数据面 Pod Running本文在单节点 Kubernetes 测试环境中完成了 Envoy Gateway 和 Gateway API 的基础

#gateway#kubernetes
Kubernetes 监控实战:使用 Alertmanager 实现邮件告警、分组路由与告警抑制

PrometheusRule 判断告警↓告警经过 PENDING 后进入 FIRING↓Prometheus 将告警发送给 Alertmanager↓Alertmanager 按 namespace 和 alertname 分组↓根据 alertname 和 notify_group 匹配路由↓critical 抑制同名 warning 和 info 通知↓通过 QQ SMTP 发送告警与恢复邮件

#prometheus
    共 27 条
  • 1
  • 2
  • 3
  • 请选择