
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文详细介绍了在单节点Kubernetes集群中使用HAMi实现NVIDIA GPU共享的完整流程。主要内容包括:部署前的环境检查(NVIDIA驱动和容器运行时配置)、HAMi的Helm安装方法、关键组件验证,以及多个核心功能的测试验证:显存切分(固定值和百分比)、GPU算力比例限制、设备型号/UUID指定等。重点澄清了nvidia.com/gpu资源的误解,指出该字段表示申请的GPU设备实例数而
本文记录了在Kubernetes单节点集群(配备NVIDIA RTX 3070Ti显卡)上测试VolcanovGPU与HAMi-core实现GPU共享调度的过程。测试验证了四个核心场景:1)单Pod成功申请vGPU资源(2000Mi显存/30%核心);2)VolcanoJob通过minAvailable实现GangScheduling,确保两个worker同时调度;3)资源不足时PodGroup保
原因是本文是单节点测试集群,没有云厂商 LoadBalancer,也没有安装 MetalLB,所以 Envoy Gateway 创建出来的 LoadBalancer Service 没有获得外部 IP。这不是 Gateway YAML 写错。Envoy 数据面 Pod Running本文在单节点 Kubernetes 测试环境中完成了 Envoy Gateway 和 Gateway API 的基础
PrometheusRule 判断告警↓告警经过 PENDING 后进入 FIRING↓Prometheus 将告警发送给 Alertmanager↓Alertmanager 按 namespace 和 alertname 分组↓根据 alertname 和 notify_group 匹配路由↓critical 抑制同名 warning 和 info 通知↓通过 QQ SMTP 发送告警与恢复邮件
Job↓Workload↓LocalQueue↓↓其中:Workload 是 Kueue 实际排队和准入的对象;LocalQueue 是 Namespace 中的任务入口;ClusterQueue 管理资源配额和排队策略;ResourceFlavor 描述资源类型和节点约束。但是,只理解这些基础对象还不够。在实际的多租户 Kubernetes 集群中,还会遇到以下问题:一个 ClusterQueu
本文完成了一个 KServe + vLLM + Gateway API 的最小闭环实验。1. 安装 cert-manager2. 安装 KServe 0.183. 将 KServe 切换到 Standard 模式4. 使用 InferenceService 部署本地 Qwen2.5-1.5B-Instruct 模型5. KServe 自动生成 qwen-vllm-predictor Deploym
本文完成了一个从模型下载到 Kubernetes 部署的完整小模型推理服务实践。ModelScope 下载 Qwen2.5-1.5B-Instruct↓模型保存到宿主机 /data/models↓nerdctl 单独启动 vLLM 进行验证↓Kubernetes Pod 通过 hostPath 挂载模型目录↓vLLM 加载本地模型↓Volcano Scheduler 调度 vGPU 资源↓Serv
做到这里,VLLMService Operator 已经不只是创建 Deployment 了,它开始具备完整服务编排的雏形。-> Pod-> Pod-> Service这一步非常关键,因为 Service 是后续接入流量入口的基础。没有 Service,HTTPRoute 就没有稳定的后端目标;-> Pod-> Service-> Gateway也就是说,Service 是从“模型 Pod 能跑起
存储准备完成后,就可以创建 VLLMService 资源了。metadata:spec:labels:port: 8000resources:requests:cpu: "2"limits:cpu: "4"storage:这里需要明确一点:VLLMService 本身只是用户声明的期望状态,它并不会直接运行模型。真正运行模型的是 Operator 根据这个 VLLMService 自动创建出来的
收到 Reconcile 请求↓根据 namespace/name 读取 VLLMService↓如果 VLLMService 不存在↓说明资源已删除,直接结束↓如果 VLLMService 存在↓构造同名 Deployment 对象↓调用 CreateOrUpdate↓设置 Deployment labels↓首次创建时设置 Deployment selector↓设置 replicas↓生成







