
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
上周我的Agent跑了一整晚的任务链–5个模型轮番上阵,42次API调用,第二天醒来一看账单,懵了。花了多少钱?哪个模型最慢?输出质量有没有退化?全不知道。这不是我一个人的问题。踩完这些坑,我总结出一条铁律:生产级Agent必须有三层监控–Token追踪(花钱账本)+ 质量预警(健康体检)+ 调用链可视化(病历档案)。缺任何一层,你都是在盲人摸象。这篇文章从Week6的4个AtomicIntege

摘要: 在构建LangChain4j多Agent代码审查流水线时,通过4个专业Agent(CodeReader、CodeAnalyzer、CodeSuggester、CodeValidator)的分工协作,实现了高效代码审查。关键发现包括: 多Agent协作优势:通过条件分支设计(问题多时深度循环审查,问题少时快速单次审查),4个Agent分工处理不同阶段任务,比单Agent全流程处理效率更高。

文章摘要:构建高效Agent测试体系的实践与思考 本文深入探讨了Agent测试的独特挑战与解决方案。作者指出Agent测试比传统单元测试和RAG测试更难,因其需要验证工具选择、参数生成和调用顺序三个不确定点。文章提出了"控制大脑,验证手脚"的测试策略,通过Mock预设LLM决策序列,用Recorder记录Agent行为,再验证两者一致性。 实践部分展示了四个关键步骤:搭建可录制工具体系(装饰器模式

四大AI Agent架构拆解:我手敲了一个迷你版,发现了7条可迁移的设计原则

本地大模型开发,听起来挺酷,但实际体验如何?今天在M1 Pro上把Ollama跑通,用LangChain4j

本文通过对比测试GLM-5.1和Qwen3-8B模型,总结了四个关键发现:1)Prompt泄露是LLM通病,需依赖管道层防御而非模型自身;2)模型延迟与参数量无必然联系,推理基础设施影响更大;3)主流模型均已具备稳定输出JSON能力;4)83毫秒的回归测试套件是模型切换的安全网。文章详细介绍了A/B测试框架设计、自动评分机制和Mock驱动的回归测试方法,强调模型评估应基于数据而非直觉,并提供了应对

摘要: 如何测试非确定性输出的LLM应用?作者分享了自研的Java测试体系,分为三层: Mock管道测试:通过预设响应模拟LLM调用,实现0 Token、毫秒级验证34条断言,覆盖安全、路由、输出等场景,发现正则匹配的语序敏感性问题。 LLM-as-a-Judge:用独立模型评估输出质量(准确性/完整性/安全性/格式),结合Mock测试确保逻辑与质量双达标,4条用例平均分4.94/5。 Badca

LangChain4j的agentic模块确实把这事儿变成了几行Java代码的事

摘要:本文揭示了滑动窗口记忆管理的致命缺陷——AI在4轮对话后就会遗忘关键信息,如用户姓名和偏好。通过对比实验,作者展示了摘要压缩技术的优势:通过LLM提炼核心实体并滚雪球式更新,确保关键信息不丢失。文章还对比了滑动窗口与摘要压缩在性能、成本和适用场景上的差异,指出滑动窗口仅适合短对话原型开发,而摘要压缩才是生产环境长对话的可行方案。最后提出Redis持久化方案,解决跨会话记忆问题,为工业级应用提

四大AI Agent架构拆解:我手敲了一个迷你版,发现了7条可迁移的设计原则








