登录社区云,与社区用户共同成长
邀请您加入社区
摘要:Kubernetes的动态特性需要监控系统具备自动发现和动态适配能力。Prometheus+Grafana已成为云原生监控标准方案,通过三层架构(节点级、容器级、应用级)全面监控集群资源。Prometheus采用Pull模式和多维数据模型,配合Grafana可视化展示。部署时推荐使用Prometheus Operator简化管理,通过ServiceMonitor自动发现监控目标。Grafan
Ollama模型已经跑起来了,为什么还要装OpenWebUI?实际接入DeepSeek试一次
文章摘要 本文详细介绍了如何使用 Prometheus 监控云原生 API 网关 Gloo Edge 的全栈可观测性方案。Gloo 由 Envoy 代理层和控制平面组成,需分别监控其流量转发(Envoy)和配置管理(控制平面)。通过 Helm 配置启用指标端口(控制平面 9091,Envoy 19000),并利用 Prometheus 抓取数据。关键指标包括控制平面的同步状态、API 事件计数,以
本文对比了两种主流服务监控方案Prometheus+Grafana和Zabbix。Prometheus原生支持容器监控,特别适合K8s环境,采用拉取模式收集指标,结合Grafana实现可视化,但配置较复杂。Zabbix作为企业级监控方案,支持服务器、网络设备等多场景监控,采用Agent/Proxy架构,功能全面但云原生支持较弱。两者各有侧重:Prometheus擅长云原生细粒度监控,Zabbix更
Prometheus 监控 APISIX 全栈实战摘要 本文全面介绍了如何利用 Prometheus 监控云原生 API 网关 Apache APISIX 的核心指标。APISIX 内置的 prometheus 插件无需额外组件即可暴露丰富指标,包括请求吞吐量、响应延迟、带宽使用、上游健康状态等关键数据。文章详细讲解了插件的启用方法(全局或路由级别)、Prometheus 抓取配置(静态和 K8s
Prometheus 默认没有 k8sgpt 的服务发现配置,需要手动添加。
本文摘要: 实战指南:提供海光BW1100 DCU部署GLM-5.1-FP8大模型的完整流程,包括环境准备、模型下载、推理部署和性能监控。 核心组件: 硬件:海光BW1100 DCU(8卡) 模型:GLM-5.1-FP8(754B参数) 推理框架:预适配的vLLM/SGLang镜像 监控方案:dcu-exporter+Prometheus+Grafana全链路可视化 关键步骤: 使用预编译Dock
我们方案:Agent每10秒扫一遍Prometheus指标,发现异常自动执行预定义的诊断流程——查日志、看堆栈、判断是否需要重启或扩容。能自动修的自己修,修不了的发告警附诊断报告。if (report.contains(“⚠️”)) sendAlert(“数据库连接池告警\n” + report);@Tool(description = “查询系统核心健康指标:CPU、内存、线程、GC、接口QPS
本文通过港口运维的比喻,系统介绍了云原生核心技术栈:Docker作为标准化容器技术,实现应用封装与隔离;Kubernetes作为容器编排系统,自动化部署与管理容器集群;Prometheus+Grafana构成监控体系,实时观测系统状态。文章重点解析了Docker的镜像分层、容器网络、数据持久化机制,Kubernetes的Pod调度、探针检测等核心概念,并以实际配置示例展示如何实现高效运维。这种"集
本文对比了两种主流监控系统架构:云原生主流的Prometheus+Grafana+Exporter探针组合与传统政务内网常用的Zabbix一体化方案。文章通过物业安防体系类比,详细解析了各组件的核心功能:Prometheus作为时序数据库主动拉取探针数据,Grafana负责可视化展示,各类Exporter探针则专用于采集不同系统的指标数据。同时介绍了Zabbix的一体化设计特点,包括其主动推送模式
本文介绍了如何使用Prometheus监控Apache Pulsar全栈系统。Pulsar作为云原生消息平台,其分层架构(Broker+BookKeeper+ZooKeeper)自带Prometheus原生支持,无需额外代理。文章详细说明了各组件(Broker、Bookie、ZooKeeper、Proxy)的Prometheus端点配置方法,包括端口设置和关键参数调整。同时提供了Prometheu
这篇文章介绍如何用Go语言编写一个迷你版Node Exporter,用于采集CPU、内存和磁盘等系统指标。文章详细展示了代码实现,包括使用gopsutil库获取系统数据、prometheus/client_golang定义指标、以及通过/metrics接口暴露数据。该工具可接入Prometheus监控系统,并提供了扩展思路如增加网络流量等指标、配合Grafana可视化等。核心要点是通过轻量级代码理
这个项目可以理解为一个小型的大模型推理平台雏形。它没有追求复杂的业务功能,而是把重点放在推理服务的工程化链路上:Gateway、鉴权、限流、监控、压测、Kubernetes 部署和CI。如果只是做大模型应用,直接调用 API 就够了。但如果想往 AI Infra、云原生、平台工程方向深入,就必须理解模型服务背后的这些基础设施能力。这个项目也算是我对这条技术路线的一次实践。
做运维、云原生开发的同学基本逃不开可观测三件套:日志、指标、链路追踪。传统方案大家无非三套:ELK、Grafana+Prometheus、Netdata,但各自痛点非常明显:组件多、吃内存、存储爆炸、无法统一排障、运维成本高。今天给大家推荐一款 Rust 开源、单容器、极低资源、超高压缩的全栈可观测平台:OpenObserve。本文一次性讲清楚:OpenObserve vs ELK vs Prom
Prometheus 作为云原生时代最核心的监控系统之一,凭借其强大的多维数据模型和灵活的查询语言 PromQL,已成为 Kubernetes 生态中监控方案的事实标准。本文将从零开始,系统介绍 Prometheus 的核心概念——时间序列、样本、指标类型、以及 Job 与 Instance,帮助读者建立扎实的理论基础。Prometheus 是一套开源的系统监控和告警工具包,由 SoundClou
Prometheus 凭借轻量化、云原生适配、灵活的 PromQL 和完整告警链路,成为 K8s 环境监控事实标准。在我的项目中,它既是集群资源可视化监控工具,也是整套 SRE 智能自愈平台的数据源头,打通了「故障采集 - LLM 决策 - 自动恢复」完整链路。同时部署、配置全程遵循 GitOps,所有监控规则代码化,运维规范、可落地到企业生产环境。
现在2.3.0.RELEASE和1.5.4.RELEASE版本的服务,都可以成功暴露出一个给Prometheus拉取指标的接口,只需要在Prometheus上进行配置即可在Prometheus WEB UI上看到效果。但生产环境的真实情况,不可能只收集一个服务的指标,是否再需要一个代理服务,该服务用来收集所有微服务的指标后,再统一暴露接口给Prometheus,需要再根据生产环境使用情况考虑。启动
Prometheus 监控系统指标(CPU、内存、磁盘)这件事很多人熟悉,但不少开发者有个共同疑问:业务特有的指标——比如队列积压数、订单待处理量、API 调用成功率——Prometheus 能监控吗?答案是:完全可以,而且比你想象的简单。Prometheus 开放的指标暴露机制是核心。只要你的服务能提供符合规范的 /metrics 接口,Prometheus 就能抓取、存储、设置告警。
《Python后端数据库连接池优化实战指南》 摘要:本文分享了9年经验后端工程师在数据库连接池优化方面的实战经验。文章首先解析了连接池的核心原理,指出连接数并非越多越好,而是需要在网络开销、内存占用与并发能力之间寻找平衡。随后详细分析了生产环境中的四大常见问题:连接泄露、MySQL 8小时自动断开、连接池大小设置不当以及事务处理不当导致的长连接。针对这些问题,作者提供了实用的监控工具和优化方案,包
Prometheus 是云原生监控的事实标准。本文从安装到查询,完整走一遍 Prometheus 的核心链路。
K8s Prometheus,针对Java的完美监控方案
本文详细介绍了如何利用Prometheus监控PHP-FPM的完整方案。主要内容包括: 开启PHP-FPM状态页并配置Nginx转发,获取JSON格式的监控数据 部署php-fpm_exporter将状态数据转换为Prometheus可抓取的指标 Prometheus配置抓取和核心指标解读,包括连接数、队列长度、进程状态等 推荐使用Grafana仪表板可视化监控数据 提供关键告警规则示例,如进程使