
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文提出用对话式Agent测试对话式系统的核心方法论。测试方需模拟真实用户的多轮对话行为(如追问、歧义表达、情绪变化),而非固定脚本。角色设计涵盖横向职能维度(5类角色)和纵向用户变体(4类消费者),以"能否测出独特系统行为"为细分标准。实现上强调多轮状态管理、自然歧义生成和并发调度,并通过UX指标(回答质量、流畅度等)进行体验评估。该方法突破了传统脚本测试的局限,使系统在真实对话场景中的表现得到
本文探讨了多Agent协作在代码开发中的优势。作者指出单个AI代理在编程时存在视角盲区,难以同时兼顾功能实现、架构设计、测试编写和代码审查等任务。通过将开发流程拆分为五个专业角色(架构设计、编码实现、测试生成、代码审查和性能优化),并保持各环节的上下文隔离,可以显著提升代码质量。 文章提出了三种流水线应用模式:完整流程适用于新功能开发,精简流程适合小改动,问题驱动模式则用于技术债清理。同时介绍了T
本地推理编排优化:单卡多实例vLLM调优实践 核心发现 在8GB显存的RTX 4070上运行三个vLLM实例(含4.5GB的Qwen3-1.7B FP8量化模型)时,通过配置调优实现: 关键参数:max_num_batched_tokens=4096显著降低medium/long prompt首token延迟43-72% 取舍验证:KV Cache Offloading提升稳定性但增加延迟;Pre
本文详细记录了基于LLaMA-Factory微调Qwen2.5-1.5B模型用于电商场景参数抽取的全过程。通过离线合成数据(1729条训练样本)和QLoRA 4bit量化技术,在8GB显存设备上完成训练,将参数抽取命中率从23.3%提升至97.8%,显著降低云端大模型调用成本。文章重点剖析了参数抽取领域的九大特有难题(如资损字段处理、类型强约束等),并分享了模板一致性、数据增强等关键踩坑经验。采用
传统混沌工程注入网络延迟、杀节点。AI Agent 还多一类模型层故障:模型返回格式错乱、超时、限流、给出矛盾结论。这类故障频率高、影响隐蔽(不 500 但答非所问),却很少被写进混沌实验。降级路径本身可能没被测过。你说"模型挂了走本地兜底",但没人真杀过模型,那条路径可能根本跑不通——这就是混沌工程要揭的"纸糊韧性"。上一节定了故障类型,动手前必须先定义稳态——系统正常时长什么样,才能判断注入后
生产级AI Agent框架的核心不是简单的"思考-行动-观察"单循环,而是由路由层、多策略执行器和生产守卫构成的三层结构。路由层负责请求预处理和意图分发,执行器针对不同任务类型(自由循环/固定步骤/直接分发)提供专门处理,守卫则通过前置的安全检查、流量控制和状态监控确保系统可靠性。关键创新点包括:递归上限作为循环断路器、状态存档支持人工干预、多执行器按复杂度分级处理,以及将安全与可观测性直接编织进
摘要 模型选型应遵循"刚好够用且最省资源"原则。实验对比了不同规模的Qwen模型在信息提取(要求<500ms)和工具选择(要求<100ms)任务中的表现。结果显示: 信息提取:Qwen3-1.7B和Qwen2.5-3B在GPU上均实现100%值匹配率,但0.5B/1.5B存在编造字段问题。 工具选择:3B模型以96%准确率最优,1.5B达92%,0.5B仅56%-58%。 硬件:GPU加速比达4.
本文探讨分布式系统中的两种"发现"机制:网络层服务发现与工具/能力发现,并以Shop-Agent客服系统为例说明其应用差异。网络层服务发现解决动态地址问题,提供DNS轮询、Consul/Nacos和Kubernetes Service三种选型方案,通过决策树指导技术选型。工具/能力发现则通过SkillRegistry自动注册实现,采用文件扫描方式动态加载技能,实现进程内工具清单管理。文章强调Sho
摘要: 客服Agent面临的分布式问题具有新形态——LLM调用长耗时改变并发模型,多Agent并行导致部分失败常态化,锁保护对象变为跨LLM调用的业务流程。具体表现为:锁保护业务实例而非数据行,部分失败呈现为语义半成品,故障沿角色链传播。与传统Web服务不同,Agent系统先耗尽连接池而非CPU,CAP选择偏向AP以保证可用性。架构上通过编排层实现并行协调,分布式锁防重入,共享依赖需隔离抖动风险。
本文详细记录了基于LLaMA-Factory微调Qwen2.5-1.5B模型用于电商场景参数抽取的全过程。通过离线合成数据(1729条训练样本)和QLoRA 4bit量化技术,在8GB显存设备上完成训练,将参数抽取命中率从23.3%提升至97.8%,显著降低云端大模型调用成本。文章重点剖析了参数抽取领域的九大特有难题(如资损字段处理、类型强约束等),并分享了模板一致性、数据增强等关键踩坑经验。采用







