logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

运维Copilot产品设计:从需求分析到技术方案的全链路思考与实践落地路径

运维Copilot的产品设计需要回归到运维工程师的真实工作流中去思考。它不是要替代工程师的判断,而是在信息检索、命令生成、诊断引导等高频重复环节提供"智能增强"。产品落地的建议路径是:从只读的告警解读和文档问答入手(MVP),逐步扩展到命令生成和诊断向导(V1),最后在积累足够的信任度和安全机制后实现Agent模式的自主执行(V2)。每一步都需要在用户价值和系统安全性之间审慎权衡——在运维场景中,

#k8s#容器#微服务
运维Copilot从概念到MVP的90天快速验证复盘:技术选型、用户反馈与迭代方向的全记录

运维Copilot在当下的真实价值是"加速信息获取和知识检索",而非"替代人工进行故障诊断决策"。这个定位的明确,将决定后续产品化阶段的投资重点和功能优先级。将AI应用到运维领域,最大的挑战不是模型能力不足,而是如何将私有化的运维知识(Runbook、架构文档、历史故障文档)高效地注入到模型中。RAG是当前最务实的方案,但它对知识库质量和时效性的依赖远高于预期。在投入产品化之前,花2-3周做一次知

#k8s#容器#微服务
运维大模型基座选型对比:Qwen、Llama、DeepSeek与ChatGLM在运维场景的性能与成本评测

大模型在运维领域的落地已从"概念验证"走向"规模应用"。Qwen2.5在中文日志分析和长上下文处理方面表现最佳,适合需要快速上线的团队,API调用成本低廉;Llama 3是私有化部署的首选,开源协议友好,生态成熟,但需要投入较多算力和人力;在代码生成和推理效率方面具有优势,特别适合自动化运维脚本生成场景,性价比突出;ChatGLM-4是国产合规场景的最佳选择,推理成本低,工具调用能力强,适合对数据

#k8s#容器#微服务
7月Linux内核与系统性能调优精华:eBPF、cgroup v2与内存管理的深度实践提炼

Linux内核是云原生架构中最底层的性能基座,对其调优投入的回报率远超直觉预期。7月的实践表明,eBPF正在成为系统可观测性的标配工具(从"锦上添花"变为"雪中送炭"),cgroup v2的资源隔离能力优于v1但迁移需要仔细规划,内存管理的优化应该是精准的(按应用类型差异化配置)而非一刀切的。建议每个运维团队至少有1-2名工程师深入掌握eBPF的BCC/bpftrace工具链,因为在线上紧急排障时

#k8s#容器#微服务
Kubernetes机器学习工作负载:运行ML任务

训练任务:训练机器学习模型。推理任务:部署模型进行推理。超参数调优:搜索最佳超参数。数据处理:处理和准备训练数据。在Kubernetes上运行ML工作负载可以实现弹性调度和资源管理。通过合理配置,可以高效地运行ML任务。希望这篇文章能帮助你部署ML工作负载。如果你有任何问题或经验分享,欢迎在评论区交流!本文作者:侯万里(万里侯),致力于机器学习的工程师。

文章图片
#k8s#容器#微服务
从3sigma到Prophet:基于机器学习的时序指标异常检测方案实践

从固定阈值到3-sigma再到Prophet,每一步都是对"更精准的异常检测"的追求。Prophet虽然不是最前沿的方案,但它在运维场景下"够用、好用、落地快"。目前我们已经在核心交易链路的5个服务上部署了Prophet异常检测,准确率稳定在90%以上,误报率比固定阈值下降了75%。如果你还在和告警疲劳作斗争,不妨试试。本文作者:侯万里(万里侯),云原生运维工程师,专注于AI驱动运维智能化和可观测

文章图片
#k8s#容器#微服务
当Prometheus遇上大模型:时序异常检测与AI辅助根因分析实战

时序异常检测解决了"发现问题"的效率问题,大模型解决了"排查问题"的效率问题。两者结合,让运维从"被动响应"转向"智能诊断"。当然,大模型的分析结果不能直接当结论,它只是一个高效的辅助工具。最终的判断和操作,还是要靠工程师的经验和判断力。本文作者:侯万里(万里侯),云原生运维工程师,专注于AI驱动运维智能化和可观测性体系建设。

#k8s#容器#微服务
当你的排查助手变成了AI:大模型辅助根因分析在线上故障排查中的应用

大模型辅助排查不是要把运维工程师"优化掉"。它做的是把信息搜索和初步分析的时间从20分钟压缩到2分钟,让你能把更多精力花在"判断"和"决策"上。就像自动驾驶一样——L2级别的辅助,仍然需要你手握方向盘、时刻关注路况。但有了辅助,你会开得更轻松、更安全。本文作者:侯万里(万里侯),云原生运维工程师,专注于AI驱动运维智能化和故障自愈体系建设。

文章图片
#k8s#容器#微服务
从发现到定位的最后一公里:机器学习时序异常检测与根因分析结合实践

从"多个维度独立检测"到"跨维度关联分析",这是运维可观测性从L2向L3演进的关键一步。机器学习做时序检测发现异常,日志聚类聚合错误模式,关联引擎连接指标和日志,LLM给出最终分析——这四层组合起来,让"发现到定位"的平均时间从40分钟降到了8分钟。

文章图片
#k8s#容器#微服务
告别手动写复盘:大模型根因分析报告自动生成方法详解

data_extractor.py — 多源数据提取器"""从多个数据源提取故障相关的数据""""""提取摘要数据(控制token量)"""# 每个数据源都返回摘要而非全量数据# Prometheus:只返回异常指标的摘要'top_anomalies': metrics['anomalies'][:5], # 只取前5个'summary': f"检查了{metrics['total']}个指标,发

文章图片
#k8s#容器#微服务
    共 195 条
  • 1
  • 2
  • 3
  • 20
  • 请选择