
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
控制变量、等价类划分、边界值分析、多次采样、归因分层不是AI测试独有的,是科学实验几百年沉淀下来的方法论。但在AI测试里,它们比传统测试更重要。因为AI系统的不确定性更大、链路更长、输入空间更广,没有这些思维兜底,测出来的结论经不起推敲。工具会变,框架会变,但思维方式不会过时。
本文探讨了RAG系统中生成层的作用与实现机制。文章指出生成层的核心功能不是"找答案"而是"组织答案",将检索到的内容转化为用户可直接使用的自然表达。通过拆解真实流程,揭示了教学资料(静态知识)和用户指令(动态需求)的分工关系:资料提供内容,指令决定表达方式。重点解析了Prompt的构造方法,强调其由模板、检索结果和用户指令拼接而成。最后指出生成层的关键在于确
文章摘要:本文讨论了CV模型评测中的关键问题与指标体系构建。首先指出仅依赖准确率指标的局限性,特别是样本不平衡时的误导性。随后提出完整的CV评测指标体系,包括准确率(需结合权重)、召回率(用户视角)、混淆矩阵(错误分析)和P99延迟(性能瓶颈)。在版本对比方面,强调环境对齐、样本覆盖度和结果波动分析的重要性。最后对比了CV模型(确定性)与Agent系统(概率性)的评测差异,指出CV评测需关注指标选
本篇记录一次多文档 RAG 测试中的真实踩坑过程:从 PDF 解析异常(内容未进入 chunks),到多文档污染(scope 依赖 top1),再到显式文档约束解析与跨文档对比边界控制。通过增加 forced_doc 规则、compare gate 以及 scope 回归断言,逐步稳定多文档行为,并以 v0.4 版本打 tag 冻结代码。本篇聚焦问题暴露与修复过程,而非算法优化。
本文分析了RAG系统中检索层的工作原理及常见问题。检索层通过词面匹配(分词+计数排序)从文档中找出与问题最相关的片段,但存在三类核心问题:同义词导致的漏召回、通用词引发的误召回、以及top_k限制造成的召回不完整。文章强调检索层决定了RAG系统的上限,即使生成模型再强,错误的检索结果也必然导致错误回答。测试重点应关注参数设置(top_k/min_score)对召回效果的影响,确保检索层能准确完整地
性能测试分层理论,梳理一下L2 状态层的压测。在 Agent 系统里,真正危险的不是慢,而是乱。这一篇只讲 L2:状态层压测,我是如何一步步定位出三个问题的。
RAG系统需要门控层来判断检索结果是否足以支持回答,避免"合理胡说"。门控层进行三类核心判断:无证据直接拒绝、证据不足不回答、证据完整才允许生成。典型风险包括错误放行、过度拒绝和多文档污染。测试需验证拒绝机制、回答能力和边界情况。门控层是RAG可控性的核心,决定是否允许生成而非生成内容,通过证据判断和风险控制确保回答可靠性。
本文提出一个可落地的 RAG 六层调试模型:解析 → Chunk → 检索 → Scope → Gate → 生成。将 RAG 问题从“模型玄学”拆解为六个可观测层级,逐层定位问题来源:是 PDF 解析失败?是切分丢信息?是检索误命中?是多文档污染?是规则门控失效?还是模型生成偏移?通过日志化每一层的输入与输出,结合回归测试与 Scope / Gate 规则,可以把 RAG 系统从“偶尔答错”变成

文章摘要:生成层评估需关注三大核心问题:1)幻觉控制(避免编造无依据内容),通过构造无答案场景测试;2)表达质量(确保自然流畅),通过多次生成对比表达稳定性;3)格式可用性(符合用户需求),需测试输出长度和结构合规性。测试方法应包含三类用例(正常/无答案/表达),采用简单判断标准,并通过多次运行验证稳定性。
本文分析了AI系统中Tool执行层和状态层的工作机制。Tool层负责执行业务逻辑(如数据库操作、服务调用),而状态层负责数据持久化(如JSONL日志、数据库)。文章指出状态层最容易出现并发写入、数据不一致等问题,建议采用文件锁、事务等机制保证一致性。完整的AI系统执行链路为:用户输入→LLM决策→Tool调用→状态更新→返回响应。在测试中,需重点关注Tool触发准确性、参数校验和状态更新可靠性。本







