【AI测试实战】从零接手CV大模型测试
本文是一次真实项目的过程复盘。没有理论,只有踩坑和摸索出来的方法。如果你也刚接手一个完全陌生的AI测试方向,希望这篇对你有用。
阶段一:接手——先跑起来,再说别的
接手项目的时候,我对cv大模型这块了解不多,前面主要还是在测试Agent 系统。
第一步没有去啃文档,而是让AI(cc)直接读交接文档,帮我梳理出核心链路——数据从哪来、怎么识别、结果怎么输出。同时自己开始部署环境,安装Xcode、Android Studio,遇到报错直接丢给cc排查。
很快环境跑起来了。
这一步的核心判断是:先把上一个迭代跑通,建立最基本的感知,再谈测什么、怎么测。 什么都不懂的时候,跑起来比读文档更有效。
阶段二:需求理解——越问越乱,最后自己断定
新迭代需求来了,第一个问题是:数据集怎么准备?
按常规思路,去问上一个迭代的同事。但他已经调去别的部门,找他很麻烦,每次只能问一点,他还让我去问另一个同事。问了几轮之后发现,不同同事站的角度完全不同——有人从APP测试角度讲,有人从算法角度讲,越问越乱。
最后的解法是:停止问人,自己断定。
我是这个迭代的主要测试,得有自己的判断。跟AI反复聊了需求文档,梳理出核心问题:
∙ 这个迭代测的是什么场景?
∙ 验收标准是什么?
∙ 数据集要覆盖哪些变量?
∙ 哪些是基准,哪些是扩展?
最后确定:基准先行。先跑标准场景(固定角度、固定休息类型、支持列表内动作),通过之后再加变量。这个决策不是别人给的,是自己跟AI来回碰出来的。
教训:需求阶段不要靠问人拼答案,要自己建立判断框架,AI是最好的陪练。
阶段三:数据集准备——困难重重
基准确定了,下一步是去准备数据集。
第一个困难:我不懂健身动作。站姿弯举、过头臂屈伸、坐姿腿屈伸……对我来说都是新词。好在旁边有个经常健身的同事,拉着他和另一个同事一起去健身房拍。
第二个困难:健身房不欢迎拍摄。只能找人少的时间去,还是经常被人赶。拍摄条件很难控制。
第一版拍完,发给算法那边跑了一轮,反馈了一堆问题:
∙ 部分动作不标准
∙ 拍摄距离太远,关键点识别不稳定
∙ 有些设备不在画面内
关键决策:没有等拍完所有视频再发,而是拍一批发一批,快速拿到反馈。 第二轮拍摄就有经验了,明显好很多。
这是数据集准备最重要的经验:不要追求一次完美,小批量迭代比大批量一次交付稳。
阶段四:数据标注——AI帮了大忙,但不是万能的
视频拍完,下一步是整理和标注——每条视频要说明动作大类、小类、顺序,文件名要规范。
100多条视频,如果纯手工整理,保守估计三四个小时。
这里用AI辅助,主要做两件事:
1. 批量命名:按规则生成文件名,不用自己一个个改路径和语法
2. 分类整理:给定动作序列,帮忙归类和校验格式
最终压到一个多小时。但这里有个坑:AI不是万能的,开始自己也不知道怎么跟AI协作,一步步摸出来的。 先命名,再分类,再校验,不能指望一个prompt全搞定,还是要拆开来一步步做。
阶段五:测试执行——跑出来的不只是数据
数据集准备好,开始跑测试。这个阶段最大的挑战不是技术,是协调。
开发联调经常出问题,提测一拖再拖,项目经理同时在催。这种压力下,测试很难做得扎实。
但这轮我坚持做了几件事:
让cc看代码,不只看表面现象。
比如发现休息段小动作容易误触发active,表面看是识别问题。让cc看代码之后发现:SDK对classId的判定没有置信度门槛,哪怕置信度只有51%也会切换状态。这个发现让问题描述从”识别不准”变成”缺少置信度过滤”,性质完全不同。
边测边梳理问题链,不等写报告才整理。
这轮发现了一条问题链:前面动作识别遗留问题→连带休息识别失效→真实设备场景进一步放大。这条链是在测试过程中跟AI反复聊才拼出来的,不是测完才发现的。
报告框架提前定,数据填进去就行。
测之前就把报告结构跟AI碰好:背景/环境/标准/范围/数据/结论/发现/跟进,八块定死。测完数据填进去,不用重新想结构。
阶段六:复盘——沉淀成下次能用的东西
这轮跑完,沉淀了三样东西:
CV模型评测SOP:
分层验证(L1姿态估计→L2动作分类→L3场景逻辑),测试启动checklist,bad case分类模板。
AI协作手册:
每个测试环节固定谁来做——cc负责代码侧,Claude负责文档和思维侧,自己负责执行和判断。不临时想,按环节走。
报告模板:
这轮报告本身就是模板,下次改数据就行。
最后,
这轮最大的收获不是方法论,是一个认知:
AI不是用来替你做测试的,是用来放大你的判断的。
你得先有问题意识、有测试经验、知道哪里可能出错,AI才能帮你挖得更深。没有这个前提,AI给的东西只是信息,不是洞察。
从一无所知到跑完一个CV迭代,不是因为AI有多厉害,是因为每一步都在问对问题。
更多推荐



所有评论(0)