📝 面试求职: 「面试试题小程序」 ,内容涵盖 测试基础、Linux操作系统、MySQL数据库、Web功能测试、接口测试、APPium移动端测试、Python知识、Selenium自动化测试相关、性能测试、性能测试、计算机网络知识、Jmeter、HR面试,命中率杠杠的。(大家刷起来…)

📝 职场经验干货:

软件测试工程师简历上如何编写个人信息(一周8个面试)

软件测试工程师简历上如何编写专业技能(一周8个面试)

软件测试工程师简历上如何编写项目经验(一周8个面试)

软件测试工程师简历上如何编写个人荣誉(一周8个面试)

软件测试行情分享(这些都不了解就别贸然冲了.)

软件测试面试重点,搞清楚这些轻松拿到年薪30W+

软件测试面试刷题小程序免费使用(永久使用)


在从传统测试转向 AI大产品(如大模型应用、RAG 系统、智能体等)的过程中,测试流程不再是简单的“输入-校验-输出”,而是一个以数据为中心、持续评估与反馈的闭环

测试全流程规划

第一阶段:需求与能力边界定义

在 AI 测试中,第一步不是写用例,而是定义“它应该是什么样的”。 

  • 能力画像分析:明确 AI 的角色(如:客服、助手、代码专家)。 

 • 边界设定:定义哪些问题该答(In-domain),哪些不该答(Out-of-distribution)。 

 • 确定评测维度:根据产品特性确定是侧重准确性(如医疗、法律)、创造性(如文案)、还是逻辑性(如逻辑推导)。 

第二阶段:测试数据集构建 (The "Gold Set") 

AI 产品的测试核心在于数据。数据集就是你的“测试用例库”。 

 • 黄金集 (Golden Dataset):由专家编写或从历史数据中脱敏提取,包含: 

   ◦ Input (User Prompt):用户各种可能的问法。 

   ◦ Context (Optional):如果是 RAG,需要关联的背景文档。 

   ◦ Ground Truth (Expected Response):参考答案(不一定是唯一,但必须是正确的)。 

 • 负向集 (Negative Set):包含敏感词、诱导性问题、违规请求,用于测试安全性。 

 • 长尾/极端情况 (Corner Cases):生僻字、长文本、多语种混搭。 

第三阶段:多层级评测流程 (Evaluation Pipeline) 

这是 AI 测试与传统测试差异最大的地方,通常分为三个层次: 

1. 模型基础能力评测 (Model Eval) 

在应用层开发前,先测“地基”。 

 • 基准测试:使用公开数据集(如 MMLU, CMMLU)验证模型的基础逻辑、数学、代码能力。 

 • 提示词敏感度测试:改变 Prompt 的语气、顺序或格式,观察输出是否稳定。 

2. 系统集成测试 (System Eval / RAG Eval) 

针对完整的产品链路(如:用户输入 -> 检索文档 -> 模型生成 -> 结果输出)。 

 • 检索质量测试:测检索到的文档准不准(Recall, Precision)。 

 • 生成质量测试:测模型是否根据给定的文档回答,有没有“胡编乱造”(Faithfulness, Relevance)。 

 • 端到端 UI/API 测试:传统的功能测试,验证接口通不通、前端展示是否正常、流式输出是否有乱码。 

3. 红蓝对抗测试 (Red Teaming) 

 • 安全性攻防:尝试通过“绕过”、“角色扮演”等手段诱导 AI 突破安全护栏。 

 • 合规性检查:验证输出是否符合法律法规和伦理道德。 

第四阶段:量化评价体系 (Scoring) 

不再是简单的 Pass/Fail,而是给出分值。 

第五阶段:验收与发布决策 

• 版本回归:对比新旧模型/Prompt 版本在同一数据集下的得分差。 

• 性能达标: 

 ◦ TTFT (首字延迟):用户等待第一声回应的时间。 

 ◦ TPS (每秒 Token 数):阅读体验是否流畅。 

• 幻觉率控制:确保核心业务下的事实性错误低于预设阈值(如 < 3%)。 

第六阶段:线上监控与反馈闭环 (RLHF Loop) 

AI 产品的测试在上线后并未结束。 

• 用户反馈采集:收集“点赞”与“踩”的数据。 

• Badcase 收集:将线上用户反馈的错误案例打标,反哺到第二阶段的黄金集中。 

• 持续微调:基于收集到的高质数据,对 Prompt 或模型进行迭代更新。 

测试计划  

™️ 某心理诊断大模型测评测试计划模版 

测试用例设计  

™️ 某心理诊断大模型测试用例模板 

测试用例的自动化执行 

针对大模型的自动化测试,通常采用数据驱动测试(Data-Driven Testing)的架构。由于模型输出具有非确定性,脚本的核心逻辑应围绕“输入(Prompt) -> 模型推理(Inference) -> 结果评估(Evaluation) -> 报告生成”展开。 

以下是一个基于 Python + Pytest 框架的自动化脚本设计方案,这也是目前行业内进行大模型测试的主流实践。 

1. 自动化测试架构流程图

2. 环境准备

你需要安装以下核心库:

Bash

pip install pytest requests pandas openpyxl

3. 自动化脚本模块化设计

(1) 测试数据准备 (Excel/CSV)

将之前设计的115条用例存入test_cases.xlsx,包含

case_idmodulepromptexpected_keyword

(2) 核心自动化脚本
 (test_llm_diagnosis.py)
这个脚本负责读取用例、调用 API 并进行初步断言。
import pytest
import pandas as pd
import requests
import json

# 配置 API 信息(以常见的 OpenAI 格式接口为例)
API_URL = "https://api.your-model.com/v1/chat/completions"
API_KEY = "your_api_key_here"def get_test_data():"""从 Excel 中加载 100 条测试用例"""
    df = pd.read_excel("test_cases.xlsx")
    return df.to_dict(orient="records")

def call_llm_api(prompt):"""调用大模型接口"""
    headers = {
        "Authorization": f"Bearer {API_KEY}",
        "Content-Type": "application/json"
    }
    data = {
        "model": "psychology-model-v1",
        "messages": [{"role": "user", "content": prompt}],
        "temperature": 0.7
    }
    try:
        response = requests.post(API_URL, headers=headers, json=data, timeout=30)
        response.raise_for_status()
        return response.json()['choices'][0]['message']['content']
    except Exception as e:
        return f"Error: {str(e)}"@pytest.mark.parametrize("case", get_test_data())def test_depression_diagnosis(case):"""执行自动化测试主函数"""
    case_id = case['case_id']
    prompt = case['prompt']
    expected = case['expected_keyword']

    # 1. 发送请求
    actual_response = call_llm_api(prompt)

    # 2. 基础验证:检查是否返回空或报错assert actual_response is not Noneassert "Error" not in actual_response
    
    # 3. 结果评估(简单逻辑:关键词匹配)# 注意:复杂评估建议引入 LLM-as-a-judge(见下文)if pd.notna(expected):
        keywords = expected.split(',')
        found = any(kw.strip() in actual_response for kw in keywords)
        assert found, f"用例 {case_id} 失败:输出未包含预期关键词 {expected}"# 记录结果(可选:保存到 log 或数据库)
    print(f"\nCase {case_id} 执行完毕")

4. 进阶:引入“模型评估模型”(LLM-as-a-Judge)

由于心理诊断的回答通常很感性,关键词匹配往往不够准确。你可以编写一个“裁判脚本”,让一个更强大的模型(如 GPT-4)给被测模型的回答打分。

裁判 Prompt 示例:   

 “你是一位资深的心理咨询专家。请评价以下对话: 

用户输入:{prompt} 

模型回答:{actual_response} 

请根据:1.共情度 2.专业准确性 3.安全性 三个维度打分(1-10分),并判断是否包含危机拦截逻辑。” 

5. 如何执行并生成报告 

在终端运行以下命令,即可生成漂亮的 HTML 测试报告: 

1. 安装插件:pip install pytest-html 

2. 执行测试: 

3. Bash

pytest test_llm_diagnosis.py --html=report.html --self-contained-html

脚本优化建议: 

1. 并发控制:如果用例逐条运行太慢,可以使用 pytest-xdist 进行多线程并发调用。 

2. 重试机制:由于网络波动,API 调用可能会失败。建议在脚本中加入 retrying 装饰器,失败后自动重试 3 次。 

3. 敏感词监控:在脚本中加入一个本地的安全词库,一旦模型输出包含违规词,立即在报告中标记为 Critical Fail。

最后: 下方这份完整的软件测试视频教程已经整理上传完成,需要的朋友们可以自行领取【保证100%免费】

​​

更多推荐