一、测试人在未来的核心竞争力

1、传统测试转为 AI 测试的变化

  1. 传统测试人员的工作:大量时间花在执行测试上。页面功能操作、执行测试用例、提交缺陷、版本回归验证等。
  2. AI 测试人员的工作
  • 设计测试的标准化流程:拆解测试流程、制定测试规则、规范输出标准、设置人工复核节点。
  • 沉淀可复用测试资产:将测试经验固化为可复用的资产。搭建 Bug 库、风险库、规则库、模板库、经验库等。
  • 训练 AI 测试 Skill 模型:利用测试资产,让 AI 按照测试人员的测试思维持续输出内容。

2、登录功能例子

  • 手工执行测试:测试账号密码登录、测试验证码登录、测试登陆失败、测试忘记密码等。
  • 设计工作步骤:拆登录方式、识别用户角色、识别异常路径、识别安全风险、生成用例、输出回归范围。
  • 沉淀测试资产:账号状态规则、验证码规则、风险规则、多端登录规则、历史 Bug、安全测试清单等。
  • 训练测试 Skill:输入登录需求、AI 自动生成用例、AI 自动补充风险点、AI 自动输出回归建议、AI 自动生成测试报告初稿。

3、AI 测试人员应具备的能力

        AI 的优势是根据规则填充内容到模板中、执行重复操作,能提供 80 分的初稿;要达到更全面的覆盖需要测试人员进行完善。

  • 设计能力:具备设计测试流程、编写固定测试资产的能力。
  • 理解能力和发散思维:理解底层业务逻辑、不限于产品提供的表面需求的能力。
  • 决策能力:识别 AI 未覆盖的测试点和风险、缺陷的影响范围和程度、回归的范围等。

4、AI 测试工作流

4.1、核心定义

       它不等于让 AI 全自动干活,而是将测试经验结构化、系统化、流程化,引导 AI 贴合人的测试思维稳定产出高质量测试成果。

  • 测试经验 Prompt 化
  1. 定义:把人脑里的测试经验,转化为 AI 可执行的规则
  2. 针对问题:直接简单提问生成的 Prompt 质量差,产出用例存在范围模糊、风险覆盖不全、输出不稳定等问题。
  3. 高质量 Prompt:不仅仅是根据需求文档命令 AI 生成测试用例,而是说明角色,任务,核心测试点、核心风险、输出规范作为约束。
  • 测试知识 Markdown 化
  1. 定义:把测试知识沉淀为固定的学习资产。Markdown 化本质是将测试经验结构化,AI 善于读取规则化结构。
  2. 针对问题:单纯 Prompt 无法让 AI 长期记忆业务测试经验,难以复用。AI 无法提取学习,新人上手成本高。
  • 测试流程 Skill 化
  1. 定义:本质是标准化、可复用的整套测试流程,由 Prompt、知识库、约束规则、输出格式、执行步骤、案例库组合而成。
  2. 问题:仅用简单 Prompt 时,相同需求 AI 每次输出内容、结构、覆盖范围都不一致;Skill 通过固定角色、规则、输出格式、参考案例,让 AI 产出稳定统一、覆盖完整、方便复核。
  • 测试动作工作流化
  1. 定义:将测试里重复、机械的测试动作拆解为标准化固定步骤,交由 AI 按流程自动执行。把个人经验变成团队流程,把临时动作变成标准资产。
  2. 案例,Bug 分析 AI 标准工作流:录入 Bug 信息→提取报错现象→定位影响模块→推荐日志关键词→给出 SQL 排查思路→匹配历史同类缺陷→输出回归范围→测试人员人工确认根因与方案,产出结构化完整分析报告。
  • 测试资产长期复用化
  1. 定义:收集历史 Bug、风险问题 → 用 Markdown 结构化归档,完善场景、根因、修复方案等要素 → 按模块、风险等级打标签分类管理 → 统一存储资产库 → AI 工作流自动调取使用。
  2. 针对问题:多数测试团队经验仅存于老员工脑中,依靠口头传递,查找困难、新人不知情,同类问题反复踩坑,无法复用。

4.2、购物车功能测试案例

  • 测试经验 Prompt 化:把人脑里库存、优惠券、并发等购物车测试经验整理成规范指令,明确 AI 覆盖范围、输出格式,给 AI 清晰的测试导向。
  • 测试知识 Markdown 化:将购物车历史 Bug、高频风险、关联模块等经验结构化归档为 MD 知识库,让 AI 能够调取、学习过往业务踩坑经验。
  • 测试流程 Skill 化:搭建专属购物车测试 Skill 文件夹,统一存放业务规则、生成指令、输出模板、历史缺陷、用例评分标准,固定 AI 执行逻辑,保证每次输出格式、覆盖范围稳定统一。
  • 测试动作工作流化:拆解标准化执行步骤:录入需求→AI 拆解模块→识别风险→生成用例→补充边界场景→输出回归方案,最后人工复核;自动完成重复整理工作,提升测试效率。
  • 测试资产长期复用化:沉淀用例、历史 Bug、风险规则、回归策略等全类测试资产;后续新任务执行时,AI 自动调取历史资产,提醒风险、补充测试点,避免重复踩坑,经验持续迭代增值。

二、引导 AI 输出高质量结果

1、如何让 AI 生成高质量的测试结果

        只告诉 AI 功能需求,那么测试结果只停留在表面功能;高级测试更关注异常路径和风险,因此除了需求文档,还需要丰富的测试经验文档:

  • 边界值:测试系统最容易出现问题的位置。如登录功能,边界值大小、长度、特殊字符、SQL 注入、前后空格、空白转义字符等。
  • 真实用户行为:AI 默认用户会正常使用功能,但真实使用场景用户通常会乱点。如支付功能,连续多次点击支付、多端同时支付、弱网、断网重连、支付过程中刷新等。
  • 历史 Bug:反应发生过的事故,有可能重复发生。如支付功能,超卖、重复支付、MQ 重复消费、优惠券重复消费、订单状态不同步等。
  • 缺陷规律:存在于历史缺陷、线上事故、老测试经验里。如支付功能,改订单状态影响库存、改支付回调影响退款、改优惠券影响结算。
  • 业务风险:支付成功/失败只看了功能,但测试更关注业务风险。

2、测试 Prompt 八大结构要素

  • 角色:给 AI 指定专业身份(高级测试工程师、Java 测试工程师等),决定 AI 的思考视角;无角色时 AI 只会做通用文本分析,指定角色后输出更专业、贴合技术场景。
  • 业务背景:补充项目、模块、业务链路、关联系统信息,解决 AI 无项目记忆的问题;相同现象(如订单异常)在电商 / 酒店 / 金融业务风险完全不同,完整背景能让 AI 精准识别业务风险。
  • 测试目标:明确本次测试侧重点(功能 / 安全 / 性能),划定 AI 的分析方向;同一登录功能,不同测试目标产出的测试点完全不一样,目标清晰才能避免泛泛而谈。
  • 风险点:主动告知业务核心高危问题(支付重复扣款、订单超卖、并发锁异常等);AI 不会自动识别业务致命风险,明确风险才能让 AI 聚焦关键场景,避免漏测核心故障。
  • 历史缺陷:提供项目过往线上 Bug、高频踩坑案例;AI 无项目记忆,补充历史问题后,AI 会自动增加对应回归用例,规避重复踩坑。
  • 输出格式:规定返回内容结构(用例表格、Bug 分析固定字段等);无格式约束时 AI 输出杂乱大段文字,结构化格式能让产出可直接落地、便于评审复用。
  • 测试策略:指定测试方法论(风险驱动、边界值驱动、场景驱动、性能驱动等);不同策略会完全改变 AI 的测试思路,决定测试深度。
  • 边界规则:明确输入边界、异常场景(空值、超长字符、特殊符号、超时、并发等);边界是 Bug 高发区,AI 不会主动覆盖,手动定义边界才能完善异常覆盖。

        订单 Prompt 示例:

templates / 专业 Prompt - 订单 - 完整版.md
【1. 角色】你是一名高级电商订单测试工程师。
【2. 业务背景】@elements/02 - 业务背景 - 订单.md
【3. 测试目标】为「订单取消支持部分退款」新逻辑生成测试用例。
【4. 风险点】@elements/04 - 风险点 - 支付.md
并额外关注:订单状态机、退款金额、券返还。
【5. 历史缺陷】@assets / 历史 Bug - 支付.md
【6. 输出格式】@elements/06 - 输出格式 - 用例.md
【7. 测试策略】风险驱动 + 边界值测试。
【8. 边界规则】弱网、超时、重复点击、异常回调、并发取消。
请生成用例,并附 P0 回归清单。

3、Prompt 链路

3.1、定义

  • 单一 Prompt 的问题:单一 Prompt 无法完成复杂测试工作,缺少分步拆解、上下文递进,AI 输出宽泛、漏测严重、无法精准定位根因,只能得到浅层通用答案。
  • Prompt 链路:把完整测试思维拆分成多步有序 AI 任务,输入任务信息 → AI 分步拆解分析 → 人工校验判断 → 输出完整落地结论;每一步都有专属输入、定向 AI 提问、阶段性产出。让 AI 一步步分析,思路更清晰、结果更准确可控。

3.2、五大常用测试 Prompt 链路

  • 用例生成链路:1.明确需求与目标。 2.识别高风险点。 3.分析边界条件。 4.梳理正常 / 异常 / 并发 / 扩展业务场景。5.结合历史 Bug 补充回归场景。 6.AI 批量生成测试用例。7.人工评审优化补全。

优势:规避漏风险、漏边界、漏异常、漏历史问题,用例覆盖全面。

  • Bug 分析链路:AI 自动提取日志异常(筛选关键信息)、分析 SQL(快速查数据)、理解问题(归纳问题)、梳理服务调用链(定位异常环节)、基于证据链推导根因、输出影响范围 + 修复 + 回归建议。
  • SQL 排查链路:1.输入 SQL 语句。2. AI 分析表结构(表、字段、关联关系)。3. 识别性能风险(全表扫描、无索引、大回表、排序消耗)。4.优化 SQL 建议(给出索引优化、SQL 改写、分库分表建议等)。5. 推荐排查步骤(执行计划、索引检查等)。6.生成结论与修复建议(根因+修复方案+验证方法)。7. 人工结合业务,确认方案并执行。

优势:解决测试人员不擅长复杂 SQL 调优的痛点,快速定位性能瓶颈。

  • 接口测试链路(最容易 Skill 化):1.输入接口文档。2. AI 识别请求参数(提取入参、类型、必填/选填项、示例等)。3. 识别业务规则(业务规则、依赖规则)。4. 生成正常/异常流/边界值/安全测试(生成覆盖核心业务场景正常用例、异常场景用例、边界、注入越权敏感信息相关用例)。5. 自动生成 pytest 等接口测试脚本。6. 人工补充特殊业务风险。
  • 日志分析链路:1.上传异常日志片段。2. AI 提取 timeout、duplicate key 等报错关键词。3. 区分错误类型、级别、预估影响范围。4. 梳理服务调用链路,定位异常模块。5. 匹配历史同类故障,给出排查步骤。6. 输出根因推测、修复方案。

4、Skill

4.1、价值

        AI 测试的核心竞争力不在于写单句 Prompt,而在于搭建完整测试 Skill 系统。零散 Prompt 只是短期工具,Skill 才是能长期提升测试质量、沉淀团队能力的解决方案。

4.2、六大组成模块

  • Prompt(prompts:Skill 的启动入口,只负责告知 AI 本次要完成什么任务、任务边界、分析重点。本身不携带项目经验、行业测试规范。
  • 知识库(knowledge):给 AI 提供持久化、结构化的项目业务、技术经验。弥补 Prompt 无记忆的缺陷,让 AI 记住项目历史踩坑,输出有依据、贴合业务。(业务流程、模块背景、历史高频故障、通用排查方案、中间件异常处理文档等。)
  • 测试规则(rules):统一团队测试质量标准,规定 AI 必须覆盖的测试点、校验逻辑,避免 AI 漏测高风险场景。(领域规则:支付需覆盖幂等、重复扣款、事务回滚、优惠券同步;通用接口规则:空参数、Token 失效、SQL 注入、越权、重复请求校验。)
  • 输出结构(outputs):规定 AI 返回内容的固定字段、层级、表格格式。输出清晰可落地,省去人工二次整理,便于评审、沉淀、自动化处理。
  • 工作流(workflows):模拟资深测试完整思考步骤,把复杂测试任务拆分为有序分步 AI 执行流程(即前文 Prompt 链路)。分层递进分析,避免一步提问遗漏关键步骤,推理更深入、结论更精准。
  • 经验资产(assets):长期沉淀的全量项目踩坑知识库,是 Skill 的核心竞争力。(历史 Bug 库、高风险模块库、日志异常库、回归规则库。)赋予 AI “老测试直觉”,自动识别历史同类风险,提前规避重复线上事故,实现团队经验传承。

4.3、目录结构

  • system/ 全局规则定义层:定义AI 角色设定、通用测试规则、全局配置、统一评审标准。
  • prompts/ 任务执行入口层:标准化调用入口,可复用、可迭代;统一调度底层知识库与规则,保证每次任务执行标准一致。
  • cases/ 真实故障案例库:沉淀线上真实事故、历史缺陷完整复盘案例,AI 可自动匹配同类场景,提前规避重复踩坑。
  • workflows/ 分步工作流:把复杂测试任务拆解为有序分步执行流程,模拟资深测试完整思考链路。
  • outputs/ 标准化输出模板:统一 AI 所有交付物的固定字段、层级结构,规范输出格式。
  • scoring/ 质量评分体系:统一质量衡量标尺,AI 可自主对照规则优化输出;团队评审标准统一,减少主观分歧。
  • templates/ 业务场景复用模板:沉淀各业务模块标准化测试思路、覆盖要点,属于通用场景复用工具。
  • assets/ 长期核心经验资产库:沉淀团队核心知识壁垒,人员流动不会丢失经验,越沉淀 AI 越专业。

5、测试经验拆解为标准markdown文件

  • 拆解 1,触发条件:绝大多数线上故障不会随时复现,仅在特定条件下触发。如库存超卖触发条件:高并发下单、锁机制缺失、缓存延迟。
  • 拆解 2,业务场景故障只会在真实业务流量场景下暴露。典型场景:秒杀支付、优惠券抢购、大流量直播下单、早晚业务高峰期。
  • 拆解 3,日志特征日志是系统最真实现场记录,关键词、报错堆栈、报错模块构成问题指纹,是快速定位根因的核心线索。如统一收录报错关键词(timeout)、异常服务模块(payment_service)、高频根因(数据库慢查询 slow query),结构化存入日志特征库。AI 自动扫描代码,提前预警隐患,形成数据库风险识别能力。
  • 拆解 4,SQL 特征:慢查询、锁等待、全表扫描、事务超时等数据库类故障。结构化沉淀字段:表现(接口响应 10 秒)、高频原因(未命中索引)、SQL 特征(select *;where 条件字段未建索引)、风险等级、优化建议(建立索引;覆盖索引)。
  • 拆解 5,风险等级:统一团队优先级标准,AI 自动区分故障轻重,优先覆盖高危场景,合理分配测试人力。
  • 拆解 6,回归范围:故障并非孤立,会沿业务、数据、MQ 链路扩散;高级测试可预判全链路影响模块。如支付超时会连锁影响:订单状态、库存事务、优惠券状态、退款链路、MQ 消费。
  • 拆解 7,历史缺陷:作为回归测试核心依据,AI 自动匹配同类模块历史缺陷,避免重复踩相同线上故障。

三、实战练习

1、安装 AI 命令行终端(CLI)

  • 安装 Copilot CLI:
# 通过 npm 全局安装
npm install -g @github/copilot

# 安装完成后验证版本
copilot --version
  • GitHub 身份认证:
# 启动交互式会话,会自动引导认证
copilot

# 按照提示在浏览器中完成 GitHub OAuth 授权
# 认证成功后即可开始使用

2、创建 Skill 目录

        打开终端:

        在当前项目创建:

        在系统用户创建(对所有项目生效):

        skill 配置成功:

        创建目录:

3、编写 Skill

  • SKILL.md:定义这个 Skill 完整业务执行流程、约束、输出规范,是 AI 干活的操作说明书。
  • references:存放辅助参考文档,给 AI 提供额外判断依据,不直接执行,但 SKILL.md 里会引用这里的规则。
  • openai.yaml

4、使用 Skill

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐