logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【创新实训】三、Agent编排层重构与多工具协同调试

上周跑通的基本流程是一次顺序调用,这周我发现很多分析场景下工具调用不是线性的——有时需要先并行查多个指标再综合判断,有时需要根据查询结果决定下一步查什么,有时查到的信息互相矛盾需要Agent自己分辨。这些需求把我自己写的那个简单ReAct循环逼到了极限,于是这周花了大量时间重构编排层,同时完成了日志检索工具的接入和三个工具协同的端到端调试。对象,每个节点执行时生成一条记录,包含节点名称、开始时间、

#运维开发
【创新实训】八、OpsPilot项目总结:一次智能运维Agent的探索之旅

OpsPilot是一个面向运维场景的智能助手。它基于Prometheus监控体系,结合大模型的理解能力和知识库的经验积累,帮助运维人员处理监控告警、分析故障原因、给出处理建议,并在安全可控的范围内执行一些自动化操作。整个项目围绕“发现问题—分析问题—解决问题—事后复盘”这条主线展开,目标是让运维人员从高频重复的应急响应中解放出来。

#运维
【创新实训】二、Agent工具链落地与第一个分析流程打通

Agent的第三步思考是“根据已有信息,结论还不够充分,缺少进程级别的数据”,但当前版本还没有接入进程监控,所以Agent在最终输出中给出了一个带局限性的结论:可能是某类计算密集型任务或异常流量导致,建议优先检查服务日志中是否有大量请求涌入,同时登录机器执行top命令确认具体进程。这周我把PromQL查询工具从伪代码变成了可运行的实现,同时搭建了知识库检索的基础设施,并且成功跑通了第一个简单的故障

#运维开发
【创新实训】六、系统测试、性能优化与联调冲刺

现在各个模块陆续完工,这周的任务是把所有东西捏在一起,跑通完整的“监控—分析—决策—执行—复盘”闭环,同时解决测试中暴露的各种问题。我主要负责Agent编排层的稳定性优化、工具调用的性能调优,以及和前端、监控、知识库三个方向的同学做密集联调。对于日志检索超时的问题,我实现了指数退避重试机制:第一次超时后等1秒重试,第二次等2秒,第三次等4秒,最多重试3次。结果大模型接收到的上下文瞬间膨胀,响应时间

#运维开发
到底了