logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【AI测试方法论】五个科学实验思维,通吃CV/RAG/Agent测试

控制变量、等价类划分、边界值分析、多次采样、归因分层不是AI测试独有的,是科学实验几百年沉淀下来的方法论。但在AI测试里,它们比传统测试更重要。因为AI系统的不确定性更大、链路更长、输入空间更广,没有这些思维兜底,测出来的结论经不起推敲。工具会变,框架会变,但思维方式不会过时。

#人工智能#自动化
Agent & RAG 测试工程笔记15:生成层到底在干嘛?从“两个输入搞不清”到彻底理顺

本文探讨了RAG系统中生成层的作用与实现机制。文章指出生成层的核心功能不是"找答案"而是"组织答案",将检索到的内容转化为用户可直接使用的自然表达。通过拆解真实流程,揭示了教学资料(静态知识)和用户指令(动态需求)的分工关系:资料提供内容,指令决定表达方式。重点解析了Prompt的构造方法,强调其由模板、检索结果和用户指令拼接而成。最后指出生成层的关键在于确

#算法#人工智能#自动化
AI模型评测不只看准确率-CV与Agent评测指标体系梳理

文章摘要:本文讨论了CV模型评测中的关键问题与指标体系构建。首先指出仅依赖准确率指标的局限性,特别是样本不平衡时的误导性。随后提出完整的CV评测指标体系,包括准确率(需结合权重)、召回率(用户视角)、混淆矩阵(错误分析)和P99延迟(性能瓶颈)。在版本对比方面,强调环境对齐、样本覆盖度和结果波动分析的重要性。最后对比了CV模型(确定性)与Agent系统(概率性)的评测差异,指出CV评测需关注指标选

#人工智能#计算机视觉#机器学习
Agent & RAG 测试工程笔记 09:从 PDF 解析到多文档污染,我踩过的 4 个坑

本篇记录一次多文档 RAG 测试中的真实踩坑过程:从 PDF 解析异常(内容未进入 chunks),到多文档污染(scope 依赖 top1),再到显式文档约束解析与跨文档对比边界控制。通过增加 forced_doc 规则、compare gate 以及 scope 回归断言,逐步稳定多文档行为,并以 v0.4 版本打 tag 冻结代码。本篇聚焦问题暴露与修复过程,而非算法优化。

#人工智能#自动化#功能测试
Agent & RAG 测试工程笔记 13:RAG检索层原理拆解:从“看不懂”到手算召回过程

本文分析了RAG系统中检索层的工作原理及常见问题。检索层通过词面匹配(分词+计数排序)从文档中找出与问题最相关的片段,但存在三类核心问题:同义词导致的漏召回、通用词引发的误召回、以及top_k限制造成的召回不完整。文章强调检索层决定了RAG系统的上限,即使生成模型再强,错误的检索结果也必然导致错误回答。测试重点应关注参数设置(top_k/min_score)对召回效果的影响,确保检索层能准确完整地

#人工智能#算法#功能测试
Agent 性能测试实战(二):状态层的三类问题,是怎么被压出来的

性能测试分层理论,梳理一下L2 状态层的压测。在 Agent 系统里,真正危险的不是慢,而是乱。这一篇只讲 L2:状态层压测,我是如何一步步定位出三个问题的。

#前端#自动化#人工智能 +1
Agent & RAG 测试工程笔记 14:RAG门控层拆解:什么时候该答?什么时候必须拒绝?

RAG系统需要门控层来判断检索结果是否足以支持回答,避免"合理胡说"。门控层进行三类核心判断:无证据直接拒绝、证据不足不回答、证据完整才允许生成。典型风险包括错误放行、过度拒绝和多文档污染。测试需验证拒绝机制、回答能力和边界情况。门控层是RAG可控性的核心,决定是否允许生成而非生成内容,通过证据判断和风险控制确保回答可靠性。

#算法#人工智能#自动化
Agent & RAG 测试工程笔记 11:RAG 六层调试模型(解析 → chunk → 检索 → scope → gate → 生成)

本文提出一个可落地的 RAG 六层调试模型:解析 → Chunk → 检索 → Scope → Gate → 生成。将 RAG 问题从“模型玄学”拆解为六个可观测层级,逐层定位问题来源:是 PDF 解析失败?是切分丢信息?是检索误命中?是多文档污染?是规则门控失效?还是模型生成偏移?通过日志化每一层的输入与输出,结合回归测试与 Scope / Gate 规则,可以把 RAG 系统从“偶尔答错”变成

文章图片
#功能测试#开发语言#人工智能
Agent & RAG 测试工程笔记16:生成层怎么测?不只是“对不对”,还有“像不像人”

文章摘要:生成层评估需关注三大核心问题:1)幻觉控制(避免编造无依据内容),通过构造无答案场景测试;2)表达质量(确保自然流畅),通过多次生成对比表达稳定性;3)格式可用性(符合用户需求),需测试输出长度和结构合规性。测试方法应包含三类用例(正常/无答案/表达),采用简单判断标准,并通过多次运行验证稳定性。

#人工智能#功能测试#自动化
AI系统测试实践:Tool执行与状态管理(Agent系统最容易出Bug的地方)

本文分析了AI系统中Tool执行层和状态层的工作机制。Tool层负责执行业务逻辑(如数据库操作、服务调用),而状态层负责数据持久化(如JSONL日志、数据库)。文章指出状态层最容易出现并发写入、数据不一致等问题,建议采用文件锁、事务等机制保证一致性。完整的AI系统执行链路为:用户输入→LLM决策→Tool调用→状态更新→返回响应。在测试中,需重点关注Tool触发准确性、参数校验和状态更新可靠性。本

#人工智能#bug#自动化
    共 87 条
  • 1
  • 2
  • 3
  • 9
  • 请选择