
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文探讨了temperature参数对AI模型(deepseek-v4-pro)处理不同复杂度任务的影响。通过测试创意写作、逻辑推理和电商报告三种任务(各运行2次),发现:1)所有任务在temperature=0.3和1.0时成功率均为100%,但电商报告的平均Token(556)显著高于创意写作(190);2)temperature对Token数的影响因任务而异,未呈现稳定规律;3)结构化任务(

本文探讨了temperature参数对AI模型(deepseek-v4-pro)处理不同复杂度任务的影响。通过测试创意写作、逻辑推理和电商报告三种任务(各运行2次),发现:1)所有任务在temperature=0.3和1.0时成功率均为100%,但电商报告的平均Token(556)显著高于创意写作(190);2)temperature对Token数的影响因任务而异,未呈现稳定规律;3)结构化任务(

本文提出了一种针对智能体(Agent)缺陷的新型分类体系,将常见问题划分为7大类型:规划缺陷(25%)、工具缺陷(20%)、执行缺陷(15%)、记忆缺陷(10%)、知识缺陷(15%)、安全缺陷(10%)和性能缺陷(5%)。通过电商数据分析智能体的实际案例,展示了各类缺陷的表现形式、根因分析和修复方案。文章强调智能体缺陷应按执行阶段(规划/执行/反思/总结)而非功能模块进行分类,并提供了包含缺陷定位

本文探讨了电商数据分析智能体在多工具组合场景下的集成测试方法,重点分析了工具链组合测试的三种模式(线性、分支、并行)及其挑战。测试结果显示,3个代表性工具链(竞品分析、数据分析、多竞品抓取)执行成功率100%,但并行场景样本量不足。文章提出了15个测试场景用例集,并分享了失败传播验证脚本和测试报告模板。核心发现包括:工具间数据传递是主要难点,格式转换错误是常见缺陷类型,并行执行稳定性仍需大规模验证

本文探讨了电商数据分析智能体在多工具组合场景下的集成测试方法,重点分析了工具链组合测试的三种模式(线性、分支、并行)及其挑战。测试结果显示,3个代表性工具链(竞品分析、数据分析、多竞品抓取)执行成功率100%,但并行场景样本量不足。文章提出了15个测试场景用例集,并分享了失败传播验证脚本和测试报告模板。核心发现包括:工具间数据传递是主要难点,格式转换错误是常见缺陷类型,并行执行稳定性仍需大规模验证

本文探讨了AI智能体在数据分析任务中的可靠性问题,通过5个真实CSV任务测试发现,尽管表面上任务能完成,但可能存在分组统计错误、数值计算编造等问题。文章介绍了一个完整的测试流程,从测试设计到缺陷发现,包括多维评分(规划、工具使用、代码能力、知识)和缺陷检测。测试结果显示,5个任务全部执行成功并通过60%的门禁要求,平均得分68.8%,但存在子任务规划过多、知识维度评分偏低等问题。文章强调了测试数据

本文探讨了AI智能体在数据分析任务中的可靠性问题,通过5个真实CSV任务测试发现,尽管表面上任务能完成,但可能存在分组统计错误、数值计算编造等问题。文章介绍了一个完整的测试流程,从测试设计到缺陷发现,包括多维评分(规划、工具使用、代码能力、知识)和缺陷检测。测试结果显示,5个任务全部执行成功并通过60%的门禁要求,平均得分68.8%,但存在子任务规划过多、知识维度评分偏低等问题。文章强调了测试数据

本文介绍了AI测试技能包中的性能压测和视觉巡检方案。性能压测采用"一份spec生成三种脚本(k6/JMeter/Locust)"的模式,通过声明式配置降低门槛,并构建分析-规划-执行-报告四阶段流水线。视觉巡检通过Playwright全站截图生成HTML报告,作为上线前的视觉兜底。两者共同组成发布前的"双保险":压测保障性能指标,截图保障UI展示。文章还分享

现在都要求AI提效,大家肯定也用过通用AI工具写测试脚本,结果它每次给的代码都不一样,同一个接口今天用 requests、明天用 httpx,断言风格也不统一。更崩溃的是,老员工一走,他积累的那些测试经验——哪个接口容易超时、哪个参数容易越界、哪个场景容易漏测——就跟着人一起走了。这是我的一整套skills,21 个目录、133 个文档、15 个可执行脚本,我叫它"AI 测试技能包"。这篇文章,我

本文介绍了LLM版本升级时的回归测试方法论。通过电商数据分析智能体案例,展示了qwen-plus到qwen3.5-plus升级时30%用例行为发生变化的情况。提出了三层测试体系:黄金用例集(30-50个核心功能用例)、参考用例集(50-100个非核心用例)和探索用例集(新场景测试)。重点阐述了行为差异检测方法,包括版本对比看板、Diff报告生成和灰度发布策略。提供了黄金用例集模板、Python实现








