《博主简介》

小伙伴们好,我是阿旭。
专注于计算机视觉领域,包括目标检测、图像分类、图像分割和目标跟踪等项目开发,提供模型对比实验、答疑辅导等。

《------往期经典推荐------》

一、AI应用软件开发实战专栏【链接】

项目名称项目名称
1.【人脸识别与管理系统开发2.【车牌识别与自动收费管理系统开发
3.【手势识别系统开发4.【人脸面部活体检测系统开发
5.【图片风格快速迁移软件开发6.【人脸表表情识别系统
7.【YOLOv8多目标识别与自动标注软件开发8.【基于深度学习的行人跌倒检测系统
9.【基于深度学习的PCB板缺陷检测系统10.【基于深度学习的生活垃圾分类目标检测系统
11.【基于深度学习的安全帽目标检测系统12.【基于深度学习的120种犬类检测与识别系统
13.【基于深度学习的路面坑洞检测系统14.【基于深度学习的火焰烟雾检测系统
15.【基于深度学习的钢材表面缺陷检测系统16.【基于深度学习的舰船目标分类检测系统
17.【基于深度学习的西红柿成熟度检测系统18.【基于深度学习的血细胞检测与计数系统
19.【基于深度学习的吸烟/抽烟行为检测系统20.【基于深度学习的水稻害虫检测与识别系统
21.【基于深度学习的高精度车辆行人检测与计数系统22.【基于深度学习的路面标志线检测与识别系统
23.【基于深度学习的智能小麦害虫检测识别系统24.【基于深度学习的智能玉米害虫检测识别系统
25.【基于深度学习的200种鸟类智能检测与识别系统26.【基于深度学习的45种交通标志智能检测与识别系统
27.【基于深度学习的人脸面部表情识别系统28.【基于深度学习的苹果叶片病害智能诊断系统
29.【基于深度学习的智能肺炎诊断系统30.【基于深度学习的葡萄簇目标检测系统
31.【基于深度学习的100种中草药智能识别系统32.【基于深度学习的102种花卉智能识别系统
33.【基于深度学习的100种蝴蝶智能识别系统34.【基于深度学习的水稻叶片病害智能诊断系统
35.【基于与ByteTrack的车辆行人多目标检测与追踪系统36.【基于深度学习的智能草莓病害检测与分割系统
37.【基于深度学习的复杂场景下船舶目标检测系统38.【基于深度学习的农作物幼苗与杂草检测系统
39.【基于深度学习的智能道路裂缝检测与分析系统40.【基于深度学习的葡萄病害智能诊断与防治系统
41.【基于深度学习的遥感地理空间物体检测系统42.【基于深度学习的无人机视角地面物体检测系统
43.【基于深度学习的木薯病害智能诊断与防治系统44.【基于深度学习的野外火焰烟雾检测系统
45.【基于深度学习的脑肿瘤智能检测系统46.【基于深度学习的玉米叶片病害智能诊断与防治系统
47.【基于深度学习的橙子病害智能诊断与防治系统48.【基于深度学习的车辆检测追踪与流量计数系统
49.【基于深度学习的行人检测追踪与双向流量计数系统50.【基于深度学习的反光衣检测与预警系统
51.【基于深度学习的危险区域人员闯入检测与报警系统52.【基于深度学习的高密度人脸智能检测与统计系统
53.【基于深度学习的CT扫描图像肾结石智能检测系统54.【基于深度学习的水果智能检测系统
55.【基于深度学习的水果质量好坏智能检测系统56.【基于深度学习的蔬菜目标检测与识别系统
57.【基于深度学习的非机动车驾驶员头盔检测系统58.【太基于深度学习的阳能电池板检测与分析系统
59.【基于深度学习的工业螺栓螺母检测60.【基于深度学习的金属焊缝缺陷检测系统
61.【基于深度学习的链条缺陷检测与识别系统62.【基于深度学习的交通信号灯检测识别
63.【基于深度学习的草莓成熟度检测与识别系统64.【基于深度学习的水下海生物检测识别系统
65.【基于深度学习的道路交通事故检测识别系统66.【基于深度学习的安检X光危险品检测与识别系统
67.【基于深度学习的农作物类别检测与识别系统68.【基于深度学习的危险驾驶行为检测识别系统
69.【基于深度学习的维修工具检测识别系统70.【基于深度学习的维修工具检测识别系统
71.【基于深度学习的建筑墙面损伤检测系统72.【基于深度学习的煤矿传送带异物检测系统
73.【基于深度学习的老鼠智能检测系统74.【基于深度学习的水面垃圾智能检测识别系统
75.【基于深度学习的遥感视角船只智能检测系统76.【基于深度学习的胃肠道息肉智能检测分割与诊断系统
77.【基于深度学习的心脏超声图像间隔壁检测分割与分析系统78.【基于深度学习的心脏超声图像间隔壁检测分割与分析系统
79.【基于深度学习的果园苹果检测与计数系统80.【基于深度学习的半导体芯片缺陷检测系统
81.【基于深度学习的糖尿病视网膜病变检测与诊断系统82.【基于深度学习的运动鞋品牌检测与识别系统
83.【基于深度学习的苹果叶片病害检测识别系统84.【基于深度学习的医学X光骨折检测与语音提示系统
85.【基于深度学习的遥感视角农田检测与分割系统86.【基于深度学习的运动品牌LOGO检测与识别系统
87.【基于深度学习的电瓶车进电梯检测与语音提示系统88.【基于深度学习的遥感视角地面房屋建筑检测分割与分析系统
89.【基于深度学习的医学CT图像肺结节智能检测与语音提示系统90.【基于深度学习的舌苔舌象检测识别与诊断系统
91.【基于深度学习的蛀牙智能检测与语音提示系统92.【基于深度学习的皮肤癌智能检测与语音提示系统
93.【基于深度学习的工业压力表智能检测与读数系统94.【基于深度学习的CT扫描图像肝脏肿瘤智能检测与分析系统】
95.【基于深度学习的CT扫描图像脑肿瘤智能检测与分析系统】96.【基于深度学习的甲状腺结节智能检测分割与诊断系统】

二、机器学习实战专栏【链接】,已更新31期,欢迎关注,持续更新中~~
三、深度学习【Pytorch】专栏【链接】
四、【Stable Diffusion绘画系列】专栏【链接】
五、YOLOv8改进专栏【链接】持续更新中~~
六、YOLO性能对比专栏【链接】,持续更新中~

《------正文------》

引言

机器学习(ML)是人工智能(AI)的一个分支,专注于创建能从数据中学习的系统。它在计算机视觉(机器解释图像)、自然语言处理(机器理解和生成人类语言)等众多AI领域中占据核心地位。

通常,这类AI模型会借助深度学习技术基于数据进行预测。尽管这些系统可能极为高效,但并非总能做出正确预测——有些输出准确,有些则可能偏离目标。

了解这些错误的发生方式是评估模型性能的关键。为此,我们可采用模型评估指标,其中常见的包括准确率(总体正确性)、精确率(正例预测的可靠性)和召回率(模型识别实际正例的能力)。它们看似相似,实则各有侧重,分别聚焦于模型行为的不同方面。

本文将深入剖析这些AI模型性能指标,探讨它们之间的相互关系,以及如何为特定用例选择合适的指标。

模型评估指标的重要性

机器学习模型初看可能表现良好,但缺乏正确的评估指标,就难以理解其结果的准确性。这些指标为模型评估提供了结构化方法,有助于解答一个关键问题:对于给定任务,模型的预测是否有用且可靠?

准确率、精确率和召回率等指标为AI开发人员提供了衡量模型运行状况的清晰方式。例如,在比较不同模型时,这些指标能明确显示哪个模型更适合特定任务,助力评估性能并指导选择最符合AI项目目标的模型。

img

图1. 模型训练和评估工作流程

这些指标还使性能比较更具客观性。它们不依赖猜测或不完整的观察,而是提供可衡量的洞察力,帮助了解模型在不同情况下的行为,进而突出每种情况下最重要的性能方面。

例如,指标的选择通常取决于应用场景。在AI医疗保健应用中,召回率至关重要,因为目标是尽可能多地识别阳性病例,即便会错误标记某些阴性病例。相比之下,电子邮件垃圾邮件过滤器可能更看重精确率,以避免将合法邮件误判为垃圾邮件。

混淆矩阵:分类指标的基础

混淆矩阵是一个二乘二的表格,是评估AI模型的基础。它通过对比实际结果与预测结果(模型给出的答案),将预测分为四个类别。

这种对比能详细呈现模型性能,是精确率、召回率等关键评估指标的计算基础,这些指标直接源于矩阵中的数值。

表格的行代表实际类别,列代表预测类别,每个单元格显示该类别中的结果数量。简言之,它能清晰展示正确预测的数量以及模型产生的误差类型。

当数据不平衡(某些类别示例远多于其他类别),或不同类型错误的代价不同时,混淆矩阵尤为有用。

例如,在欺诈检测中,捕捉欺诈活动至关重要,但错误标记真实交易也会引发问题。混淆矩阵能清楚显示每种错误的发生频率。

混淆矩阵的要素

以下是混淆矩阵中不同元素的概述:

  • 真阳性(TP):模型正确预测阳性实例,例如计算机视觉模型正确分类图像中的车辆。

  • 真阴性(TN):模型正确识别阴性实例,例如电子邮件分类器将常规邮件标记为非垃圾邮件。

  • 假阳性(FP):模型错误地将负类实例预测为正类,即I型错误,例如欺诈检测系统将有效交易标记为欺诈交易。

  • 假阴性(FN):模型未能检测到阳性病例,错误地将其预测为阴性,即II型错误,例如诊断工具遗漏了实际患病患者的疾病。

img

图2. 混淆矩阵的组成部分

混淆矩阵的可视化表示和解释

混淆矩阵以网格形式呈现,纵轴为实际类别,横轴为预测类别。对角线上的是正确预测,即真阳性和真阴性;对角线外的是错误,包括假阳性和假阴性。这种结构便于发现模型的优势与劣势。

准确率

准确率是评估机器学习模型性能最广泛使用的指标之一,用于衡量所有类别中预测正确的频率,回答“在AI模型的所有预测中,正确的占比多少?”这一问题。

准确率的计算公式为:正确预测的数量(包括真阳性和真阴性)除以预测的总数。它计算简单、易于理解,是模型评估的常见起点。

通常,在处理平衡数据集时,准确率较为可靠。但在不平衡数据集中,准确率往往具有误导性,因为其中一个类别可能占主导地位。始终预测多数类的模型可能仍有较高准确率,却无法检测到其他少数类。

例如,在一个只有少数图像包含行人的图像数据集中,一个对每张图像都预测“没有行人”的模型可能准确率很高,却完全无法检测到实际的行人。

这是因为准确率无法体现模型错误的类型和发生频率。因此,需同时查看精确率和召回率等指标,以全面了解AI模型的表现。

精确率:最大限度减少误报

精确率是衡量模型预测正例准确性的关键指标,回答“在所有预测为正例的实例中,正确的占比多少?”

精确率的计算公式为:真阳性数量除以真阳性与假阳性之和。当阳性预测错误的代价较高时,精确率尤为重要。

img

图3. 精度和准确率比较

例如,在欺诈检测中,低精确率的模型可能将许多有效交易标记为欺诈,给用户和支持团队带来不必要的麻烦。而高精确率的模型能确保标记的交易更可能是实际欺诈行为,降低此类风险。

不过,过于关注精确率的模型可能会过于挑剔,从而遗漏实际正例。因此,通常需将精确率与召回率一同检查,以平衡模型性能。

召回率

召回率(又称灵敏度或真正率)用于衡量模型识别实际正例的能力,回答“在所有实际正例中,模型正确检测到的占比多少?”

召回率的计算公式为:真阳性数量除以真阳性与假阴性之和。高召回率表明模型能捕获数据中大多数真实阳性案例。

在医疗保健等行业,召回率至关重要,因为未能检测到病情可能延误治疗,危及患者安全。此时,即使错误标记某些阴性病例,识别所有真阳性病例仍是首要任务。

然而,仅关注召回率的模型可能会标记过多假阳性,降低精确率并损害模型整体效率。因此,平衡召回率和精确率对AI模型的可靠性能至关重要。

精确率和召回率的平衡

精确率和召回率通常呈反向变化,一个指标提高,另一个可能下降,这是机器学习任务中的常见挑战。

高精度模型仅在确信时才将实例预测为正例,这减少了误报,但可能遗漏真正的正例,导致召回率下降。而试图捕获所有正例的模型会提高召回率,却可能增加误报,降低精确率。

调整模型的决策阈值(系统将分数或概率转换为操作或标签的截止值)时,这种权衡更为明显。降低阈值会使系统更频繁地做出阳性判断,可能提高召回率但降低精确率;提高阈值则相反,模型预测的阳性结果更少,精确率提高但召回率通常下降。

以垃圾邮件检测为例,模型需平衡垃圾邮件进入收件箱与真实邮件被拦截的风险。严格的过滤器可能遗漏部分垃圾邮件,而宽松的过滤器可能意外拦截合法邮件。合适的平衡取决于具体用例及每种错误的代价。

精确率-召回率曲线的意义

精确率-召回率曲线(PR曲线)展示了随着模型决策阈值变化,精确率和召回率的变化情况,曲线上每个点代表两者间的不同权衡。PR曲线在非平衡数据集(某一类别频率远低于其他类别)中尤其有用。

相较于受试者工作特征(ROC)曲线(同样展示模型在不同决策阈值下区分正例和负例的能力),PR曲线能提供更有意义的洞察。高精确率和高召回率的模型,其精确率-召回率曲线接近右上角,这通常是理想状态。

F1分数:一种平衡的综合指标

F1分数提供了一个单一值,用于衡量精确率和召回率之间的平衡。其计算方法为:精确率和召回率乘积的两倍除以精确率与召回率之和。当假正例和假负例都很重要,或处理不平衡数据集、需要平衡看待模型性能时,F1分数非常有用。

img

图4. 使用精确率和召回率计算F1分数

其他指标

尽管准确率、精确率和召回率至关重要,但根据模型类型和数据集特征,其他指标也能提供额外见解。以下是一些常用指标,有助于评估性能的各个方面:

  • 特异性:衡量模型识别实际负样本的能力,在需避免假阳性时很有用。

  • AUC:即曲线下面积,给出一个单一分数,反映模型区分不同类别的能力。

  • 对数损失:用于衡量模型预测的置信度,对高置信度下的错误预测给予更重惩罚(置信度指模型对其预测的确定程度)。

  • 多标签评估:在多标签任务中,指标在标签间取平均值,以反映整体模型性能。

在计算机视觉中应用准确率、精确率和召回率

了解了准确率、精确率和召回率后,我们来看看它们在计算机视觉中的应用。

诸如Ultralytics YOLO11等计算机视觉模型支持物体检测等任务,该模型能识别图像中存在的物体,并通过边界框定位它们。每个预测都包含物体标签及其位置,这使得评估比单纯检查标签正确性更复杂。

img

图5. 使用Ultralytics YOLO11进行物体检测的示例

以零售应用为例,通过摄像头自动跟踪货架上的产品,对象检测模型可识别麦片盒、苏打水罐、瓶装水等物品并标记其位置。

在此场景中,精确率反映检测到的项目中实际正确的比例,高精确率意味着系统能避免将阴影或背景物体误判为产品;召回率显示模型成功检测到的货架上真实产品的数量,高召回率意味着遗漏商品更少,这对准确的库存计数至关重要。

准确率仍能提供正确性的大致度量,但在这种情况下,即使遗漏几个产品或检测到不存在的物品,都可能对库存管理产生重大影响。因此,开发人员会综合考虑精确率、召回率和准确率,以确保系统在实际使用中既可靠又实用。

总结

准确率、精确率和召回率分别从不同方面展示机器学习模型的性能,仅依赖一个指标可能产生误导。

混淆矩阵、精确率-召回率曲线和F1分数等工具和指标有助于揭示权衡关系,指导改进ML模型的决策。为特定AI解决方案选择正确的指标组合,可确保模型在实际应用中准确、可靠且有效。


在这里插入图片描述

好了,这篇文章就介绍到这里,喜欢的小伙伴感谢给点个赞和关注,更多精彩内容持续更新~~
关于本篇文章大家有任何建议或意见,欢迎在评论区留言交流!

更多推荐