
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
《模型路由插件调试实录:从失效到自动切换的四轮迭代》摘要: 在模型路由插件开发中,团队历经四轮迭代解决自动切换失效问题。初始版本因"连续失败检测"逻辑无法处理确定性错误(如欠费400报错)而失效;后续发现检测时机被动、hook事件字段语义与预期不符(如LLM失败时agent_end仍标记success=true)、失败路径误触发成功hook等问题。通过逐轮日志诊断与源码验证,最

OpenClaw可以形象地理解为一家AI服务公司:Gateway是总机调度中心,负责接收和处理来自微信、Telegram等Channel渠道的消息;Agent是具备不同性格和职责的AI员工,依靠Provider供应商(如OpenAI、DeepSeek等)提供的LLM大脑进行思考;员工通过Skill技能包调用Tool工具完成任务,并借助Memory记忆文件和Session会话记录维持工作连贯性。整个

OpenClaw可以形象地理解为一家AI服务公司:Gateway是总机调度中心,负责接收和处理来自微信、Telegram等Channel渠道的消息;Agent是具备不同性格和职责的AI员工,依靠Provider供应商(如OpenAI、DeepSeek等)提供的LLM大脑进行思考;员工通过Skill技能包调用Tool工具完成任务,并借助Memory记忆文件和Session会话记录维持工作连贯性。整个

本文介绍了针对LLM模型调用故障的自动切换方案ModelFailoverRouter。核心内容包括:1)基于错误分类器区分瞬时/确定性错误;2)实现模型优先级路由,支持配额耗尽时自动切换备用模型;3)处理"隐身欠费"场景(表现为连续超时);4)提供全模型不可用时的汇总报告和恢复机制。文章还分享了落地过程中遇到的配置管理问题和环境版本治理经验,强调容灾设计需考虑故障的多种表现形式

本文介绍了针对LLM模型调用故障的自动切换方案ModelFailoverRouter。核心内容包括:1)基于错误分类器区分瞬时/确定性错误;2)实现模型优先级路由,支持配额耗尽时自动切换备用模型;3)处理"隐身欠费"场景(表现为连续超时);4)提供全模型不可用时的汇总报告和恢复机制。文章还分享了落地过程中遇到的配置管理问题和环境版本治理经验,强调容灾设计需考虑故障的多种表现形式

本文复盘了一次生产故障:AgentTeams集群因token配额耗尽导致系统空转4.5小时。尽管方案文档中设计了熔断、重试和人工兜底机制,但故障发生时这些措施均未生效。根本原因包括:容错引擎未接入执行链路、错误分类缺失导致确定性错误被误判为可重试、Token预算与账户配额检测维度错位。解决方案是将容错能力改造为OpenClawPlugin接入Worker执行链路,新增错误分类器区分确定性/瞬时性错

《OpenClaw源码解读》系列文章阶段性总结(20篇精华导读) 核心脉络 以"一条消息的生命周期"为主线,拆解为四大阶段: ①进程启动→②消息入站→③单Agent执行→④多Agent协同 解决源码阅读"局部清晰全局模糊"痛点,提供全景路线图 核心内容架构 【基础层】项目定位/目录结构/设计哲学(1-3篇) 【主线一】消息入站:路由解析→诊断记录→Hook拦

《OpenClaw源码解读》系列文章阶段性总结(20篇精华导读) 核心脉络 以"一条消息的生命周期"为主线,拆解为四大阶段: ①进程启动→②消息入站→③单Agent执行→④多Agent协同 解决源码阅读"局部清晰全局模糊"痛点,提供全景路线图 核心内容架构 【基础层】项目定位/目录结构/设计哲学(1-3篇) 【主线一】消息入站:路由解析→诊断记录→Hook拦

本文以OpenClaw框架中EmbeddedAgentRunner的真实运行日志为案例,深入解析了一条Matrix消息从路由入队到LLM流式返回的完整执行链路。核心流程包括:消息路由与并发控制(ACTIVE_EMBEDDED_RUNS机制)、prompt组装与孤儿消息修复、三层上下文预算检查(预检10209 tokens→精算23466 tokens→最终钳制至126533 tokens)、网关代

本文以OpenClaw框架中EmbeddedAgentRunner的真实运行日志为案例,深入解析了一条Matrix消息从路由入队到LLM流式返回的完整执行链路。核心流程包括:消息路由与并发控制(ACTIVE_EMBEDDED_RUNS机制)、prompt组装与孤儿消息修复、三层上下文预算检查(预检10209 tokens→精算23466 tokens→最终钳制至126533 tokens)、网关代








