别再搞混了!一次讲透机器学习 3 大评估指标:准确率、精确率、召回率
《博主简介》
小伙伴们好,我是阿旭。
专注于计算机视觉领域,包括目标检测、图像分类、图像分割和目标跟踪等项目开发,提供模型对比实验、答疑辅导等。
《------往期经典推荐------》
二、机器学习实战专栏【链接】,已更新31期,欢迎关注,持续更新中~~
三、深度学习【Pytorch】专栏【链接】
四、【Stable Diffusion绘画系列】专栏【链接】
五、YOLOv8改进专栏【链接】,持续更新中~~
六、YOLO性能对比专栏【链接】,持续更新中~
《------正文------》
目录
引言
机器学习(ML)是人工智能(AI)的一个分支,专注于创建能从数据中学习的系统。它在计算机视觉(机器解释图像)、自然语言处理(机器理解和生成人类语言)等众多AI领域中占据核心地位。
通常,这类AI模型会借助深度学习技术基于数据进行预测。尽管这些系统可能极为高效,但并非总能做出正确预测——有些输出准确,有些则可能偏离目标。
了解这些错误的发生方式是评估模型性能的关键。为此,我们可采用模型评估指标,其中常见的包括准确率(总体正确性)、精确率(正例预测的可靠性)和召回率(模型识别实际正例的能力)。它们看似相似,实则各有侧重,分别聚焦于模型行为的不同方面。
本文将深入剖析这些AI模型性能指标,探讨它们之间的相互关系,以及如何为特定用例选择合适的指标。
模型评估指标的重要性
机器学习模型初看可能表现良好,但缺乏正确的评估指标,就难以理解其结果的准确性。这些指标为模型评估提供了结构化方法,有助于解答一个关键问题:对于给定任务,模型的预测是否有用且可靠?
准确率、精确率和召回率等指标为AI开发人员提供了衡量模型运行状况的清晰方式。例如,在比较不同模型时,这些指标能明确显示哪个模型更适合特定任务,助力评估性能并指导选择最符合AI项目目标的模型。

图1. 模型训练和评估工作流程
这些指标还使性能比较更具客观性。它们不依赖猜测或不完整的观察,而是提供可衡量的洞察力,帮助了解模型在不同情况下的行为,进而突出每种情况下最重要的性能方面。
例如,指标的选择通常取决于应用场景。在AI医疗保健应用中,召回率至关重要,因为目标是尽可能多地识别阳性病例,即便会错误标记某些阴性病例。相比之下,电子邮件垃圾邮件过滤器可能更看重精确率,以避免将合法邮件误判为垃圾邮件。
混淆矩阵:分类指标的基础
混淆矩阵是一个二乘二的表格,是评估AI模型的基础。它通过对比实际结果与预测结果(模型给出的答案),将预测分为四个类别。
这种对比能详细呈现模型性能,是精确率、召回率等关键评估指标的计算基础,这些指标直接源于矩阵中的数值。
表格的行代表实际类别,列代表预测类别,每个单元格显示该类别中的结果数量。简言之,它能清晰展示正确预测的数量以及模型产生的误差类型。
当数据不平衡(某些类别示例远多于其他类别),或不同类型错误的代价不同时,混淆矩阵尤为有用。
例如,在欺诈检测中,捕捉欺诈活动至关重要,但错误标记真实交易也会引发问题。混淆矩阵能清楚显示每种错误的发生频率。
混淆矩阵的要素
以下是混淆矩阵中不同元素的概述:
-
真阳性(TP):模型正确预测阳性实例,例如计算机视觉模型正确分类图像中的车辆。
-
真阴性(TN):模型正确识别阴性实例,例如电子邮件分类器将常规邮件标记为非垃圾邮件。
-
假阳性(FP):模型错误地将负类实例预测为正类,即I型错误,例如欺诈检测系统将有效交易标记为欺诈交易。
-
假阴性(FN):模型未能检测到阳性病例,错误地将其预测为阴性,即II型错误,例如诊断工具遗漏了实际患病患者的疾病。

图2. 混淆矩阵的组成部分
混淆矩阵的可视化表示和解释
混淆矩阵以网格形式呈现,纵轴为实际类别,横轴为预测类别。对角线上的是正确预测,即真阳性和真阴性;对角线外的是错误,包括假阳性和假阴性。这种结构便于发现模型的优势与劣势。
准确率
准确率是评估机器学习模型性能最广泛使用的指标之一,用于衡量所有类别中预测正确的频率,回答“在AI模型的所有预测中,正确的占比多少?”这一问题。
准确率的计算公式为:正确预测的数量(包括真阳性和真阴性)除以预测的总数。它计算简单、易于理解,是模型评估的常见起点。
通常,在处理平衡数据集时,准确率较为可靠。但在不平衡数据集中,准确率往往具有误导性,因为其中一个类别可能占主导地位。始终预测多数类的模型可能仍有较高准确率,却无法检测到其他少数类。
例如,在一个只有少数图像包含行人的图像数据集中,一个对每张图像都预测“没有行人”的模型可能准确率很高,却完全无法检测到实际的行人。
这是因为准确率无法体现模型错误的类型和发生频率。因此,需同时查看精确率和召回率等指标,以全面了解AI模型的表现。
精确率:最大限度减少误报
精确率是衡量模型预测正例准确性的关键指标,回答“在所有预测为正例的实例中,正确的占比多少?”
精确率的计算公式为:真阳性数量除以真阳性与假阳性之和。当阳性预测错误的代价较高时,精确率尤为重要。

图3. 精度和准确率比较
例如,在欺诈检测中,低精确率的模型可能将许多有效交易标记为欺诈,给用户和支持团队带来不必要的麻烦。而高精确率的模型能确保标记的交易更可能是实际欺诈行为,降低此类风险。
不过,过于关注精确率的模型可能会过于挑剔,从而遗漏实际正例。因此,通常需将精确率与召回率一同检查,以平衡模型性能。
召回率
召回率(又称灵敏度或真正率)用于衡量模型识别实际正例的能力,回答“在所有实际正例中,模型正确检测到的占比多少?”
召回率的计算公式为:真阳性数量除以真阳性与假阴性之和。高召回率表明模型能捕获数据中大多数真实阳性案例。
在医疗保健等行业,召回率至关重要,因为未能检测到病情可能延误治疗,危及患者安全。此时,即使错误标记某些阴性病例,识别所有真阳性病例仍是首要任务。
然而,仅关注召回率的模型可能会标记过多假阳性,降低精确率并损害模型整体效率。因此,平衡召回率和精确率对AI模型的可靠性能至关重要。
精确率和召回率的平衡
精确率和召回率通常呈反向变化,一个指标提高,另一个可能下降,这是机器学习任务中的常见挑战。
高精度模型仅在确信时才将实例预测为正例,这减少了误报,但可能遗漏真正的正例,导致召回率下降。而试图捕获所有正例的模型会提高召回率,却可能增加误报,降低精确率。
调整模型的决策阈值(系统将分数或概率转换为操作或标签的截止值)时,这种权衡更为明显。降低阈值会使系统更频繁地做出阳性判断,可能提高召回率但降低精确率;提高阈值则相反,模型预测的阳性结果更少,精确率提高但召回率通常下降。
以垃圾邮件检测为例,模型需平衡垃圾邮件进入收件箱与真实邮件被拦截的风险。严格的过滤器可能遗漏部分垃圾邮件,而宽松的过滤器可能意外拦截合法邮件。合适的平衡取决于具体用例及每种错误的代价。
精确率-召回率曲线的意义
精确率-召回率曲线(PR曲线)展示了随着模型决策阈值变化,精确率和召回率的变化情况,曲线上每个点代表两者间的不同权衡。PR曲线在非平衡数据集(某一类别频率远低于其他类别)中尤其有用。
相较于受试者工作特征(ROC)曲线(同样展示模型在不同决策阈值下区分正例和负例的能力),PR曲线能提供更有意义的洞察。高精确率和高召回率的模型,其精确率-召回率曲线接近右上角,这通常是理想状态。
F1分数:一种平衡的综合指标
F1分数提供了一个单一值,用于衡量精确率和召回率之间的平衡。其计算方法为:精确率和召回率乘积的两倍除以精确率与召回率之和。当假正例和假负例都很重要,或处理不平衡数据集、需要平衡看待模型性能时,F1分数非常有用。

图4. 使用精确率和召回率计算F1分数
其他指标
尽管准确率、精确率和召回率至关重要,但根据模型类型和数据集特征,其他指标也能提供额外见解。以下是一些常用指标,有助于评估性能的各个方面:
-
特异性:衡量模型识别实际负样本的能力,在需避免假阳性时很有用。
-
AUC:即曲线下面积,给出一个单一分数,反映模型区分不同类别的能力。
-
对数损失:用于衡量模型预测的置信度,对高置信度下的错误预测给予更重惩罚(置信度指模型对其预测的确定程度)。
-
多标签评估:在多标签任务中,指标在标签间取平均值,以反映整体模型性能。
在计算机视觉中应用准确率、精确率和召回率
了解了准确率、精确率和召回率后,我们来看看它们在计算机视觉中的应用。
诸如Ultralytics YOLO11等计算机视觉模型支持物体检测等任务,该模型能识别图像中存在的物体,并通过边界框定位它们。每个预测都包含物体标签及其位置,这使得评估比单纯检查标签正确性更复杂。

图5. 使用Ultralytics YOLO11进行物体检测的示例
以零售应用为例,通过摄像头自动跟踪货架上的产品,对象检测模型可识别麦片盒、苏打水罐、瓶装水等物品并标记其位置。
在此场景中,精确率反映检测到的项目中实际正确的比例,高精确率意味着系统能避免将阴影或背景物体误判为产品;召回率显示模型成功检测到的货架上真实产品的数量,高召回率意味着遗漏商品更少,这对准确的库存计数至关重要。
准确率仍能提供正确性的大致度量,但在这种情况下,即使遗漏几个产品或检测到不存在的物品,都可能对库存管理产生重大影响。因此,开发人员会综合考虑精确率、召回率和准确率,以确保系统在实际使用中既可靠又实用。
总结
准确率、精确率和召回率分别从不同方面展示机器学习模型的性能,仅依赖一个指标可能产生误导。
混淆矩阵、精确率-召回率曲线和F1分数等工具和指标有助于揭示权衡关系,指导改进ML模型的决策。为特定AI解决方案选择正确的指标组合,可确保模型在实际应用中准确、可靠且有效。

好了,这篇文章就介绍到这里,喜欢的小伙伴感谢给点个赞和关注,更多精彩内容持续更新~~
关于本篇文章大家有任何建议或意见,欢迎在评论区留言交流!
更多推荐
所有评论(0)