
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
AI 测试 0 基础入门:从 LLM 到 RAG 到评测
"我理解 AI 测试和传统测试最大的区别是——传统测「对错确定」,AI 测「概率正确」。所以我重点补了三块:通用能力评测用「评测集 + 评分器 + 指标」三件套,RAG 评测分检索和生成两段抓幻觉,Agent 评测看任务成功率和工具正确率。并动手写了三个能跑的评测 demo,用 LLM-as-Judge 做语义评分,也清楚它的位置偏置和长度偏置。
到底了







