logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

你的Agent每次调用花了多少钱?我手写了一个Token追踪器,发现了3个意外

上周我的Agent跑了一整晚的任务链–5个模型轮番上阵,42次API调用,第二天醒来一看账单,懵了。花了多少钱?哪个模型最慢?输出质量有没有退化?全不知道。这不是我一个人的问题。踩完这些坑,我总结出一条铁律:生产级Agent必须有三层监控–Token追踪(花钱账本)+ 质量预警(健康体检)+ 调用链可视化(病历档案)。缺任何一层,你都是在盲人摸象。这篇文章从Week6的4个AtomicIntege

文章图片
#java#语言模型
4个Agent审一段代码,效率反而更高?——LangChain4j多Agent协作代码审查实战

摘要: 在构建LangChain4j多Agent代码审查流水线时,通过4个专业Agent(CodeReader、CodeAnalyzer、CodeSuggester、CodeValidator)的分工协作,实现了高效代码审查。关键发现包括: 多Agent协作优势:通过条件分支设计(问题多时深度循环审查,问题少时快速单次审查),4个Agent分工处理不同阶段任务,比单Agent全流程处理效率更高。

文章图片
#python
Agent测试到底怎么测?手写ReAct循环+工具调用链验证+决策路径断言,一套全跑通

文章摘要:构建高效Agent测试体系的实践与思考 本文深入探讨了Agent测试的独特挑战与解决方案。作者指出Agent测试比传统单元测试和RAG测试更难,因其需要验证工具选择、参数生成和调用顺序三个不确定点。文章提出了"控制大脑,验证手脚"的测试策略,通过Mock预设LLM决策序列,用Recorder记录Agent行为,再验证两者一致性。 实践部分展示了四个关键步骤:搭建可录制工具体系(装饰器模式

文章图片
#单元测试#java
四大AI Agent架构拆解:我手敲了一个迷你版,发现了7条可迁移的设计原则

四大AI Agent架构拆解:我手敲了一个迷你版,发现了7条可迁移的设计原则

文章图片
#架构#python
M1 Pro跑LLM实测:Ollama+LangChain4j零成本本地大模型开发,比云端API快在哪?

本地大模型开发,听起来挺酷,但实际体验如何?今天在M1 Pro上把Ollama跑通,用LangChain4j

文章图片
#java#语言模型
两个大模型同时翻车了--LLM应用A/B测试避坑实战

本文通过对比测试GLM-5.1和Qwen3-8B模型,总结了四个关键发现:1)Prompt泄露是LLM通病,需依赖管道层防御而非模型自身;2)模型延迟与参数量无必然联系,推理基础设施影响更大;3)主流模型均已具备稳定输出JSON能力;4)83毫秒的回归测试套件是模型切换的安全网。文章详细介绍了A/B测试框架设计、自动评分机制和Mock驱动的回归测试方法,强调模型评估应基于数据而非直觉,并提供了应对

文章图片
#ab测试#语言模型
大模型应用测试,90%的人都在裸奔

摘要: 如何测试非确定性输出的LLM应用?作者分享了自研的Java测试体系,分为三层: Mock管道测试:通过预设响应模拟LLM调用,实现0 Token、毫秒级验证34条断言,覆盖安全、路由、输出等场景,发现正则匹配的语序敏感性问题。 LLM-as-a-Judge:用独立模型评估输出质量(准确性/完整性/安全性/格式),结合Mock测试确保逻辑与质量双达标,4条用例平均分4.94/5。 Badca

文章图片
#功能测试#语言模型
Day30:Java程序员的多Agent协作实战:我手敲了一个代码审查流水线,跑通了

LangChain4j的agentic模块确实把这事儿变成了几行Java代码的事

文章图片
#java
你的AI在第4轮对话就失忆了——滑动窗口的致命缺陷与摘要压缩的救赎

摘要:本文揭示了滑动窗口记忆管理的致命缺陷——AI在4轮对话后就会遗忘关键信息,如用户姓名和偏好。通过对比实验,作者展示了摘要压缩技术的优势:通过LLM提炼核心实体并滚雪球式更新,确保关键信息不丢失。文章还对比了滑动窗口与摘要压缩在性能、成本和适用场景上的差异,指出滑动窗口仅适合短对话原型开发,而摘要压缩才是生产环境长对话的可行方案。最后提出Redis持久化方案,解决跨会话记忆问题,为工业级应用提

文章图片
#人工智能#语言模型
四大AI Agent架构拆解:我手敲了一个迷你版,发现了7条可迁移的设计原则

四大AI Agent架构拆解:我手敲了一个迷你版,发现了7条可迁移的设计原则

文章图片
#架构#python
    共 24 条
  • 1
  • 2
  • 3
  • 请选择