logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

AI测试智能体(agent)实战:规划→执行→反思:14年测试教你从零手写一个能跑的Agent(附源码自取)

本文分享了从零搭建AI Agent的实战经验。作者通过14年测试经验指出:Agent本质是控制流(规划→执行→反思),而非框架,建议先用Python手写理解核心逻辑。文章详解了Agent四步流程:1)任务拆解与兜底处理;2)拓扑排序执行;3)反思检查机制;4)结果汇总。特别强调三个关键点:业务场景只需改背景和工具列表、必须添加JSON解析兜底、反思机制能显著提升输出质量。文中还揭露了eval()安

文章图片
#人工智能#开发语言#功能测试 +4
【AI测试智能体20】面试官问我Temperature怎么设,我把这篇甩给了他

本文探讨了temperature参数对AI模型(deepseek-v4-pro)处理不同复杂度任务的影响。通过测试创意写作、逻辑推理和电商报告三种任务(各运行2次),发现:1)所有任务在temperature=0.3和1.0时成功率均为100%,但电商报告的平均Token(556)显著高于创意写作(190);2)temperature对Token数的影响因任务而异,未呈现稳定规律;3)结构化任务(

文章图片
#人工智能#测试用例#python +3
【AI测试智能体20】面试官问我Temperature怎么设,我把这篇甩给了他

本文探讨了temperature参数对AI模型(deepseek-v4-pro)处理不同复杂度任务的影响。通过测试创意写作、逻辑推理和电商报告三种任务(各运行2次),发现:1)所有任务在temperature=0.3和1.0时成功率均为100%,但电商报告的平均Token(556)显著高于创意写作(190);2)temperature对Token数的影响因任务而异,未呈现稳定规律;3)结构化任务(

文章图片
#人工智能#测试用例#python +3
【AI测试智能体18】智能体Bug难排查?我们总结了7大类型和35个子类型

本文提出了一种针对智能体(Agent)缺陷的新型分类体系,将常见问题划分为7大类型:规划缺陷(25%)、工具缺陷(20%)、执行缺陷(15%)、记忆缺陷(10%)、知识缺陷(15%)、安全缺陷(10%)和性能缺陷(5%)。通过电商数据分析智能体的实际案例,展示了各类缺陷的表现形式、根因分析和修复方案。文章强调智能体缺陷应按执行阶段(规划/执行/反思/总结)而非功能模块进行分类,并提供了包含缺陷定位

文章图片
#测试工具#功能测试#人工智能 +4
【AI测试智能体17】AI Agent 用 3 个工具就翻车?我们测了它的工具链

本文探讨了电商数据分析智能体在多工具组合场景下的集成测试方法,重点分析了工具链组合测试的三种模式(线性、分支、并行)及其挑战。测试结果显示,3个代表性工具链(竞品分析、数据分析、多竞品抓取)执行成功率100%,但并行场景样本量不足。文章提出了15个测试场景用例集,并分享了失败传播验证脚本和测试报告模板。核心发现包括:工具间数据传递是主要难点,格式转换错误是常见缺陷类型,并行执行稳定性仍需大规模验证

文章图片
#java#前端#服务器 +4
【AI测试智能体16】我用 5 个 CSV 任务,测透了 AI Agent 的数据分析能力

本文探讨了AI智能体在数据分析任务中的可靠性问题,通过5个真实CSV任务测试发现,尽管表面上任务能完成,但可能存在分组统计错误、数值计算编造等问题。文章介绍了一个完整的测试流程,从测试设计到缺陷发现,包括多维评分(规划、工具使用、代码能力、知识)和缺陷检测。测试结果显示,5个任务全部执行成功并通过60%的门禁要求,平均得分68.8%,但存在子任务规划过多、知识维度评分偏低等问题。文章强调了测试数据

文章图片
#人工智能#数据分析#数据挖掘 +4
【skills5】一份 spec 生成 k6/JMeter/Locust:性能压测 + 全站截图,上线前的双保险

本文介绍了AI测试技能包中的性能压测和视觉巡检方案。性能压测采用"一份spec生成三种脚本(k6/JMeter/Locust)"的模式,通过声明式配置降低门槛,并构建分析-规划-执行-报告四阶段流水线。视觉巡检通过Playwright全站截图生成HTML报告,作为上线前的视觉兜底。两者共同组成发布前的"双保险":压测保障性能指标,截图保障UI展示。文章还分享

文章图片
#jmeter#测试工具#功能测试 +4
【AI测试智能体15】回归测试与版本管理:LLM 更新后的行为漂移

本文介绍了LLM版本升级时的回归测试方法论。通过电商数据分析智能体案例,展示了qwen-plus到qwen3.5-plus升级时30%用例行为发生变化的情况。提出了三层测试体系:黄金用例集(30-50个核心功能用例)、参考用例集(50-100个非核心用例)和探索用例集(新场景测试)。重点阐述了行为差异检测方法,包括版本对比看板、Diff报告生成和灰度发布策略。提供了黄金用例集模板、Python实现

文章图片
#人工智能#功能测试#python +4
【大模型评测系列】我用 10 条真实任务对比了 GLM-5.1(百炼) vs GLM-5.2(百炼) vs DeepSeek-V4-Pro(官方)

本次评测对比了GLM-5.1、GLM-5.2和DeepSeek-V4-Pro三个大模型在10项真实测试任务中的表现。结果显示:三个模型均实现100%任务通过率,质量接近;但DeepSeek-V4-Pro在效率上优势显著,平均耗时25.2秒(比GLM-5.1快59%),平均Token消耗2092(节省38.7%)。评测涵盖用例生成、脚本编写、性能分析等测试工程全链路任务,发现国产模型已具备实用能力,

文章图片
#人工智能#服务器#python +2
【大模型评测】我用 10 条真实任务对比了 GLM-5.1(百炼) vs GLM-5.2(百炼) vs DeepSeek-V4-Pro(官方)

文章摘要: 测试员周周对GLM-5.1、GLM-5.2和DeepSeek-V4-Pro三款大模型进行了真实场景评测,覆盖10项测试工程任务。结果显示: 通过率:三模型均达100%,输出质量接近; 效率:DeepSeek-V4-Pro显著领先,平均耗时25.2秒(比GLM-5.1快59%),Token消耗减少38.7%; 成本:DeepSeek估算成本最低(0.84元/万Token)。 核心结论:国

文章图片
#人工智能#自动化#功能测试 +4
    共 97 条
  • 1
  • 2
  • 3
  • 10
  • 请选择