SCI论文精读:基于直方图和小波预处理技术的深度学习检测模型PP-YOLO:用于果园中樱桃树与苹果树检测
前言:
**SCI精读是一项高投入、高回报的科研投资。 它初期看似缓慢,但从长远看,它是构建你深厚学术功底、敏锐科研嗅觉和强大创新能力的唯一捷径。将精读养成习惯,它最终会从一项“任务”变成一种能带给你巨大成就感和乐趣的“能力”,介于此,本Up主开设sci领读课程,旨在让小伙伴们在快乐中快速具备论文写作能力!**本专栏为视频课程中的文章翻译!
原文题目如下:
PP-YOLO: Deep learning based detection model to detect apple and cherry
trees in orchard based on Histogram and Wavelet preprocessing techniques
基于直方图和小波预处理技术的深度学习检测模型PP-YOLO:用于果园中樱桃树与苹果树检测
塞马莱廷·阿克多安(Cemalettin Akdoğan)a,*、托尔加·奥泽尔(Tolga Özer)b、于克塞尔·奥古兹(Yüksel Öguz)b
a 土耳其阿菲永科贾泰佩大学博尔瓦丁职业学院,阿菲永卡拉希萨尔
b 土耳其阿菲永科贾泰佩大学电气与电子工程系,阿菲永卡拉希萨尔
文章信息
关键词:深度学习;YOLO;目标检测;直方图均衡化;小波变换;农业
摘要:随着当今技术的发展,农业领域中无人机(UAV)、人工智能(AI)等技术系统的应用日益广泛。因此,预计未来将借助基于人工智能的无人机开展喷洒和施肥流程,而这些流程的实施离不开人工智能模型的支持。本研究采用YOLOv5、YOLOv8和YOLOv9算法对农业区域中的樱桃树和苹果树进行检测。构建YOLO模型所用的数据集通过大疆御(DJI Mavic)系列无人机采集,并采用数据增强方法扩充数据集中的图像数量。该数据集包含2000张樱桃树图像和1600张苹果树图像。
本研究提出两种方案:未优化YOLO(Unprogressed YOLO,UP-YOLO)和优化预处理YOLO(Progressed and Preprocessed YOLO,PP-YOLO)。其中,UP-YOLO仅用于YOLO模型的基础训练;而所提PP-YOLO方法则在传统YOLO模型的基础上,对图像尺寸进行了重新配置,并引入空间注意力模块(Spatial Attention Module,SAM)——该模块通过突出树木的叶片颜色、叶片结构和枝干纹理,提升模型的检测性能,从而降低目标漏检率。此外,PP-YOLO还通过对图像应用直方图均衡化(Histogram Equalization,HE)和小波变换(Wavelet Transform,WT)两种图像预处理技术,进一步优化模型性能。HE和WT预处理技术可增强无人机图像中树木枝干、叶片与地面的过渡细节,并去除图像噪声。
实验结果显示:UP-YOLO的F1分数为94.3%,mAP50(IoU阈值为50%的平均精度均值)为96.9%;而PP-YOLO中采用WT预处理的YOLOv8m模型,其F1分数达到95.8%,mAP50达到98.3%。这表明PP-YOLO的F1分数和mAP50较UP-YOLO分别提升了1.5%和1.4%。进一步分析可知,在PP-YOLO的实现过程中,预处理技术使F1分数提升了0.9%,SAM模块使F1分数额外提升了0.6%。研究表明,所开发的深度学习模型在樱桃树和苹果树检测任务中具有极高的准确性。
1 引言
全球变暖是近年来最关键的问题之一(Makky等人,2024)。伴随全球变暖而来的干旱,是影响农业活动的另一重大问题。与此同时,世界人口的快速增长加剧了粮食需求,使得粮食供应成为更为关键的议题(Pallathadka等人,2022)。这种形势要求我们最大限度地提高现有农业用地的作物产量,而提高农产品生产效率是增加粮食产量的关键因素。
传统人工主导的农业操作不仅需要大量体力劳动,还耗费大量时间(Natt等人,2021),且人工操作过程中易出现失误,进而导致产量下降和收成浪费。因此,数字农业中机器人无人系统的应用日益增多,其中无人机是农业领域应用最广泛的机器人系统之一。如今,树木喷洒、施肥等诸多农业操作均可通过无人机完成。树木检测与监测技术不仅能帮助农户掌握树木的健康生长状况,还能提高喷洒和施肥的效率——通过该技术,系统可仅在目标区域施用农药或肥料,从而在降低化学品对人类和环境健康负面影响的同时,实现成本的高效利用。
在特定条件下,农户更倾向于在同一果园中混种不同树种,其原因包括维持土壤肥力、预防病害,以及平衡不同水果品种的季节性需求(Munro等人,2020)。例如,樱桃树和苹果树需要不同的传粉者,混种于同一果园可提高蜜蜂的关注度,进而改善传粉效果和果实产量(Pisman等人,2022)。此外,这两种树木对土壤和气候条件的适应性相似,也为它们在同一果园中的种植提供了便利(Yilmaz,2015)。
在土耳其,农业和水果种植领域的小型个体家庭企业占农业经营主体总数的80.7%,且这些企业占据了大部分农业用地。然而,小型家庭企业的经营模式限制了土地地块的规模,导致种植区域呈现小型化、碎片化特征。这种情况使得土耳其约70%的果园为混种果园,这些果园通常采用传统方式管理,树种搭配缺乏专业性(Sims¸ek,2023;Doğruer等人,2023)。阿菲永卡拉希萨尔地区的个体果园中,樱桃树和苹果树混种的情况也十分普遍,这与上述现状相符(Kırca和Aygün,2024)。因此,在专业化数字农业应用中,对同一区域内多种树木和水果品种进行分类检测具有重要意义。
将人工智能应用于该领域,可有效解决分类相关问题。如今,喷洒无人机的应用日益广泛,借助集成于机器人系统的人工智能技术,可实现自动化喷洒或施肥操作(Kalaichelvi等人,2023)。近年来,深度学习系统已被证实是推动农业发展与进步的关键要素(Alibabaei等人,2022),基于深度学习的农业领域水果、蔬菜或树木检测研究也受到了众多学者的关注,相关研究数量与日俱增(Du等人,2023)。
例如,Sangaiah等人(2024)采用深度学习架构中的Tiny YOLOv4模型,对稻田杂草、作物缺素区域和作物健康状况进行监测与识别,并建议将其开发的模型集成于无人机系统,该研究获得的mAP值为86%。Kumar等人(2023)指出,病虫害是粮食生产中的重大问题,且病虫害通常仅能由专业人员识别;他们采用YOLOv5算法解决病虫害检测问题,所提模型的F1分数达到90%,mAP50达到93%。
已有诸多文献研究聚焦于深度学习系统在水果检测或果实生长状态监测中的应用。Mazzia等人(2020)利用其开发的YOLOv3-tiny模型实现了苹果的实时分类,并选用树莓派3B+(Raspberry Pi 3B+)和英伟达 Jetson Nano开发套件对模型进行测试;此外,他们还将YOLOv5算法集成于无人机,用于预测苹果的采收时间,所提模型的mAP50为86.8%,检测准确率为83.64%。Han等人(2022)指出,樱桃果实的品质检测传统上依赖人工感官判断,不仅耗时耗力,还导致市场上樱桃品质参差不齐;鉴于深度学习系统的快速发展,他们采用YOLOv5模型进行樱桃检测——结合泛洪填充算法提取数据集时,模型准确率达到99.6%,而不使用该算法时准确率仅为78.6%。
除了果实的定点检测,树木整体检测的需求也日益凸显。尤其随着技术发展,农业专用无人机的应用愈发普及(Tang,2023)。近年来,基于人工智能的喷洒系统已开始用于喷洒作业,但相关研究仍较为有限(Partel等人,2020)。
Fu等人(2020)采用机器视觉系统结合深度特征,实现了密叶结果墙苹果树的检测,平均精度达到0.893;他们还通过引入深度滤波器去除背景树木干扰,使果实检测准确率提升了2.5%,该研究为基于Faster R-CNN的密叶结果墙苹果树检测提供了思路,可用于机器人采摘场景(需结合RGB图像和深度特征)。Cheng等人(2020)提出,为减少农药用量及其对环境的负面影响,应采用无人机进行喷洒;同时,他们指出传统方法易将邻近树木误判为单棵树木的问题,并通过人工智能分析结合高斯混合模型(Gaussian Mixture Model,GMM),实现了从混种树木中提取单棵树木的目标,以樱桃树和苹果树为数据集时,模型准确率达到84.3%,交并比(IoU)为88%。
Özer等人(2022)在研究中采用YOLOv5算法检测樱桃树,通过无人机采集数据,并分别基于YOLOv5m、YOLOv5s和YOLOv5x模型进行训练,其中YOLOv5s模型的F1分数最高,达到98%。YOLO模型因其实时性能优势,在目标检测领域应用广泛,但也存在一定局限性:在杂乱场景中,YOLO模型对小目标和低显著性目标的检测准确率较低,进而导致模型整体性能下降。在此背景下,SAM等注意力模块可通过突出图像中的关键区域,优化分类过程,从而提升YOLO模型的检测准确率。
直接应用人工智能技术的场景中,模型成功率往往较低。针对这一问题,可采用图像尺寸调整、HE和WT等图像预处理技术,提升模型的性能指标(Raheja等人,2020)。Mojaravscki等人(2024)采用YOLOv7深度学习架构检测农业区域中的橄榄,指出预处理技术可提升目标检测应用中模型的性能,其提出的模型结合HE和色卡校正技术,F1分数达到72.9%。Bao等人(2024)强调小麦在粮食生产和贸易中的重要性,并指出小麦赤霉病(Fusarium Head Blight,FHB)会损害小麦植株,导致其品质和产量下降;他们采用无人机采集图像,结合YOLOv5算法检测小麦赤霉病,并通过HE技术实现对病害的快速准确检测,以最大限度减少经济损失,所提模型的F1分数为73.8%。
Akdoğan等人(2024)基于深度学习技术,开发了用于樱桃树检测和喷洒的人工智能无人机,并针对樱桃树检测任务,基于YOLOv5、YOLOv7和YOLOv8架构提出两种方案;他们通过大疆御系列无人机采集了889张樱桃树图像,模型F1分数达到98%,且结合HE和WT预处理方法后,F1分数进一步提升了0.6%。
SAM模块在图像处理和深度学习等领域中,可突出图像中目标的形状、颜色等特征,帮助模型更高效、更准确地学习;同时,该模块能聚焦于含有关键目标的区域,降低背景中无关信息的干扰(Zhao等人,2024)。SAM模块可集成于ResNet、YOLO等模型所采用的各类注意力机制中,以提升模型性能。Chen等人(2022)在研究中指出,杂草对芝麻植株生长影响显著,且由于芝麻幼苗与杂草形态相似,杂草检测难度较大;为此,他们在基于YOLOv4的芝麻杂草检测模型(YOLO sesame模型)的SPP层中加入注意力模块,最终芝麻和杂草检测的F1分数分别达到91%和92%。
Zhang等人(2023)提出一种基于YOLO的深度学习模型,用于检测小麦中广泛存在的赤霉病;他们采用旋转YOLO小麦检测(Rotation Yolo Wheat Detection,RYWD)算法进行目标检测,并突出图像中的关键区域;通过在卷积层中加入简单空间注意力(Simple Spatial Attention,SSA)模块,模型准确率提升至94.66%。Zhao等人(2024)指出,石榴采收通常依赖人工,而鉴于人工采收的高强度劳动特性,基于深度学习的智能系统可大幅提高效率;他们认为原始YOLO模型在小目标检测中性能不足,因此在YOLOv5模型中集成CBAM(卷积块注意力模块),提出YOLO-Granada算法,该模型的检测准确率达到92.2%,检测速度提升17.3%。
Wang等人(2022)在研究中指出,黄花刺茄(Solanum Rostratum)这种杂草会破坏生物多样性;为此,他们在YOLOv5中集成CBAM模块,提出YOLO-CBAM模型,该模型的F1分数达到92.3%,性能优于原始YOLOv5。Wang等人(2023)则聚焦于松树病害检测,利用无人机采集的图像,开发了YOLOv8s-GAM模型;通过在骨干网络中加入注意力机制模块,对YOLOv8s模型进行优化。
对农业应用中基于人工智能的水果和树木检测现有研究进行梳理后发现,该领域仍需进一步发展,原因如下:
- 人工智能技术是当前新兴领域,相关文献研究数量较少;
- 农业领域中基于无人机图像、采用人工智能技术进行树木检测的研究十分有限;
- 针对混种果园中樱桃树和苹果树检测的研究匮乏,且阿菲永卡拉希萨尔地区的果园现状为该研究提供了适宜场景;
- 结合图像预处理技术与深度学习模型进行树木检测的研究较少;
- 现有深度学习模型可通过加入SAM模块和调整图像尺寸进一步优化性能。
鉴于上述原因,本研究旨在开发一种可应用于日益普及的无人机农业系统的人工智能模型,聚焦于阿菲永卡拉希萨尔地区常见的樱桃树-苹果树混种果园,构建基于深度学习的高精度树木检测模型。为此,所提方案致力于开发融合现有预处理技术和注意力机制的深度学习模型,以实现对樱桃树和苹果树的高精度识别。考虑到基于卷积神经网络(CNN)算法的YOLO模型在实时应用中潜力巨大,本研究选用YOLO模型解决树木检测问题,并通过构建独特数据集,测试YOLOv5、YOLOv8、YOLOv9等常用YOLO模型在樱桃树和苹果树检测中的性能。
本研究提出UP-YOLO和PP-YOLO两种不同模型:UP-YOLO方案不对数据进行任何处理,直接对YOLO模型进行训练;PP-YOLO方案则通过集成注意力模块,提升模型对树木枝干和叶片结构的学习能力,同时对数据集进行图像尺寸调整和图像预处理,以验证PP-YOLO模型在树木检测中的有效性。所提方法成功解决了混种果园中樱桃树与苹果树(形态相似)的识别问题,并提升了PP-YOLO模型在树种预测任务中的性能指标。
2 研究方法
本节详细介绍用于农业区域樱桃树和苹果树分类的人工智能系统。本研究选用目标检测领域应用最广泛的深度学习架构之一——YOLO算法进行检测。为增加数据量,本研究采用翻转和饱和度数据增强方法:增强前,两类树木(樱桃树、苹果树)的数据集共包含1200张图像;增强后,图像数量增至3600张。
在深度学习架构中,为提升所开发模型的性能指标,本研究采用了图像尺寸调整、SAM模块和预处理技术,并基于此提出UP-YOLO和PP-YOLO两种方案,以优化模型性能:
- UP-YOLO方案:不应用任何预处理技术,分别以50、100、150轮次(epoch)对YOLOv5、YOLOv8、YOLOv9模型进行训练;
- PP-YOLO方案:针对UP-YOLO方案中性能最优的YOLOv8模型进行优化,将图像尺寸重新配置为800×800,并在YOLOv8模型中加入SAM模块;同时,对数据集分别应用HE和WT预处理技术,再以50、100、150轮次进行训练。
本研究采用的人工智能方法细节如图1所示。
当前,CNN架构应用广泛,是目标检测领域常用的深度学习模型之一(Mandal等人,2021)。CNN架构具有多层结构,通过这些层级实现对数据的识别与学习。凭借这一架构,在图像分类、目标检测、人脸识别等日常生活中常见的问题中,均取得了良好效果(Vinay等人,2017)。如图2所示,CNN架构主要由输入层、特征学习层和分类层组成。本研究选用CNN架构中的YOLO算法进行检测,原因在于该算法检测速度快且准确率高。
YOLO算法是目标检测与分类等应用中广泛使用的深度学习算法之一,可实现单张图像中多目标的检测;同时,因其检测速度快、实时应用性能优异,成为主流架构之一(Lakhotiya等人,2023),因此常应用于无人机(UAV)、无人作战飞机(UCAV)等自主飞行器及机器人项目中。传统检测算法需对多幅图像进行分析以实现目标检测,而YOLO算法仅需对单张图像进行一次分析即可完成目标检测(Haritha等人,2022)。这一优势使得YOLO算法无需通过区域估计或图像缩放即可实现目标检测,模型在速度和准确率方面性能优异。
YOLO算法在速度和准确率上的优势,与其训练过程中的学习能力密切相关;而深度学习模型训练效果的衡量指标——损失函数(loss function),则是学习过程的核心。在深度学习架构中,损失函数用于衡量模型在学习过程中的性能,输出预测值与真实值的接近程度(Cho等人,2019);通过在训练过程中降低模型误差,损失函数可提升模型准确率,实现更优预测(Aigner和Körner,2020)。较高的损失值表明模型未能有效学习目标特征,分类成功率也较低。
分析式(1)可知,总损失包含三类:边界框损失(box loss)、类别损失(cls loss)和分布焦点损失(dfl loss)。其中,边界框损失用于衡量模型对目标中心位置的预测精度以及边界框对目标的包裹精度(Marchisotti和Sala,2020);类别损失是指在确定目标类别时产生的误差;分布焦点损失用于衡量数据集中各类别样本数量的不平衡性,旨在帮助模型准确识别样本数量较少类别中的目标。
总损失计算公式如下:
[
\text{total loss} = l_{\text{box}} + l_{\text{cls}} + l_{\text{dl}} \quad (1)
]
式中:(l_{\text{box}})为边界框损失,(l_{\text{cls}})为类别损失,(l_{\text{dl}})为分布焦点损失。
2.1 数据准备与训练
模型训练所用图像通过大疆御Air(DJI Mavic Air)无人机在土耳其阿菲永卡拉希萨尔地区采集,如图3所示。采集的数据集包含3600张果树图像,其中樱桃树图像2000张,苹果树图像1600张。为探究训练结束后数据集规模对模型的影响,本研究采用两种训练-测试数据划分比例:70%训练、30%测试,以及80%训练、20%测试。
通过对不同数据集分别应用HE和WT预处理技术,得到两个独立的数据集。对樱桃树和苹果树图像进行标注后,完成训练数据准备,模型训练所用数据集如图4所示。
本研究通过在线平台“Make Sense”完成数据标注。为详细分析模型结果,分别以70%训练、30%测试和80%训练、20%测试的比例,以50、100、150轮次对深度学习模型进行训练。模型训练采用的工作站配置如下:英特尔酷睿(Intel® Core™)i7-10700 CPU(主频2.90 GHz)、128 GB内存、英伟达GeForce RTX 3080显卡。训练所用的参数值如表1所示。
表1 卷积神经网络(CNN)架构所用超参数细节
| 超参数(Hyperparameter) | 取值(Value) |
|---|---|
| 优化器(Optimizer) | 随机梯度下降(SGD) |
| 训练-测试比例(%) | 70-30 和 80-20 |
| 轮次数量(Number of epochs) | 50、100、150 |
| 批量大小(Batch size) | 16 |
| 学习率(Learning rate) | 0.01 |
| 学习率衰减(Learning rate decay) | 0.00058 |
(注:图1~图4为原文中的核心图表,对应中文标注如下:
- 图1:基于人工智能的樱桃树和苹果树检测方法及所提YOLO模型流程图
(图中核心模块:UP-YOLO路径包含“原始樱桃树和苹果树数据集→数据增强→训练-测试比例与轮次→YOLOv5/YOLOv8/YOLOv9→树木检测(樱桃树/苹果树)”;PP-YOLO路径包含“原始樱桃树和苹果树数据集→数据增强→预处理技术(直方图均衡化/高斯+小波变换)→新数据集→图像尺寸调整(640×640→800×800)→加入SAM模块→YOLOv8→训练-测试比例与轮次→树木检测”) - 图2:典型卷积神经网络(CNN)架构图
(架构流程:输入层(INPUT)→卷积+ReLU激活函数(CONVOLUTION + RELU)→池化(POOLING)→卷积+ReLU激活函数→池化→展平(FLATTEN)→全连接层(FULLY CONNECTED)→Softmax函数→分类层(CLASSIFICATION);左侧标注“特征学习(FEATURE LEARNING)”覆盖卷积、ReLU、池化模块,“分类(CLASSIFICATION)”覆盖全连接、Softmax模块) - 图3:数据集采集区域(土耳其,阿菲永卡拉希萨尔)
(地图层级:世界地图(WORLD)中标注土耳其(TURKIYE),土耳其地图中标注阿菲永卡拉希萨尔(AFYONKARAHISAR)) - 图4:模型训练所用的准备数据集
(包含樱桃树(Cherry)和苹果树(Apple)的标注图像,图例中“□-Cherry”表示樱桃树标注框,“-Apple”表示苹果树标注框))
2.2 数据增强
增强前的数据集包含666张樱桃树图像和533张苹果树图像。数据增强方法可实现数据量的数值扩充,扩大数据集规模。在人工智能应用中,该方法可通过增加稀缺数据的数量、降低过拟合风险,提升人工智能模型的性能。
如表2所示,本研究对数据集应用翻转(flip)和饱和度(saturation)两种图像处理技术,使数据量翻倍。
表2 数据集规模与数据增强方法
| 项目 | 樱桃树(Cherry Tree) | 苹果树(Apple Tree) |
|---|---|---|
| 所用方法(The method used) | 翻转、饱和度 | 翻转、饱和度 |
| 数据增强前数量 | 666 | 533 |
| 数据增强后数量 | 2000 | 1600 |
| 总计(Total) | - | 3600 |
2.3 未优化YOLO(UP-YOLO)
针对樱桃树和苹果树检测构建的数据集,分别采用YOLOv5、YOLOv8、YOLOv9三种深度学习模型进行训练。训练过程不进行图像预处理,仅以80%训练-20%测试和70%训练-30%测试的比例,以50、100、150轮次进行,所用超参数值如表1所示。训练获得的性能指标将在3.2节(UP-YOLO结果)中结合图6进行详细对比。
(注:图5为UP-YOLO中SAM模块的处理架构图,中文标注为“图5:空间注意力模块(SAM)处理架构图”,架构包含“骨干网络(BACKBONE)→颈部网络(NECK)→检测头(DETECT HEAD)”,核心连接关系:骨干网络输出经卷积(CONV)、C2F模块处理后,与上采样(UNSAMPLE)结果拼接(CONCAT);颈部网络通过多次卷积、C2F、上采样、拼接操作提取特征;检测头通过检测(DETECT)模块输出结果,SAM模块集成于特征提取过程中,用于突出关键特征区域)
2.4 优化预处理YOLO(PP-YOLO)
PP-YOLO方案旨在提升UP-YOLO中所开发人工智能模型的性能:首先,将模型的标准图像尺寸重新配置为800×800;其次,针对UP-YOLO中性能最优的YOLOv8模型,加入SAM模块;此外,为提升数据处理前的质量、降低无用噪声干扰,还采用了图像预处理技术。
通过对不同数据集分别应用HE和WT预处理技术,得到两个独立的数据集。PP-YOLO方案的核心是:在UP-YOLO中F1分数最高的YOLOv8模型基础上,加入HE、WT预处理技术、图像尺寸调整和SAM模块,再对模型进行训练。
训练过程中,分别以70%训练-30%测试和80%训练-20%测试的比例,以50、100、150轮次等不同超参数值对PP-YOLO模型进行训练。在应用WT预处理前,先向数据集加入0.3强度的高斯噪声,再通过WT技术对图像进行去噪处理。实验结果显示,加噪后的峰值信噪比(PSNR)为10.478 dB,去噪后的PSNR为25.282 dB。训练获得的性能指标将在3.3节(PP-YOLO结果)中结合图9和图10进行详细对比。
2.5 所提方法
所提方法以UP-YOLO模型的优化为核心。在UP-YOLO模型中,YOLOv8模型因性能指标最优,被选为优化基础:重新配置YOLOv8模型的图像尺寸,以800×800的尺寸进行训练;训练过程中,在YOLOv8骨干网络的SPPF模块后加入SAM模块,确保模型在训练过程中更关注树木的叶片和枝干特征。
针对樱桃树和苹果树构建的两个独立数据集,分别应用WT和HE两种图像预处理技术。因此,所提方法分为两个步骤:首先,为应用两种预处理技术,准备包含相同图像的两个独立数据集——通过WT技术去除数据集中图像的噪声,得到预处理数据集;其次,对樱桃树和苹果树数据集应用HE预处理技术,得到基于直方图均衡化的图像数据集。
采用PP-YOLO架构,对通过图像预处理技术构建的两个数据集进行训练,开发人工智能模型;训练结束后,呈现模型的性能指标并进行详细分析。
2.5.1 空间注意力模块(SAM)
SAM是卷积神经网络中常用的注意力模块,通过利用像素位置间的关联,在特征提取阶段构建注意力机制,使模型聚焦于待识别目标的位置。SAM模块的处理过程结合了平均池化(AvgPool)和最大池化(MaxPool)的结果,并采用7×7卷积滤波器构建注意力机制。
本研究中,SAM模块确保模型在学习阶段主要关注树木的叶片和枝干,通过空间注意力提升模型对树木的检测精度。SAM模块的架构和计算公式分别如图5和式(2)所示。式(2)中,(\sigma)表示Sigmoid函数,(f^{7×7})表示滤波器大小为7×7的1×1卷积层。
SAM模块计算公式如下:
[
M_{s}(F) = \sigma\left(f^{7×7}([AvgPool(F) ; MaxPool(F)])\right) \quad (2)
]
式中:(M_{s}(F))为空间注意力图,(F)为输入特征图,(AvgPool(F))为对输入特征图的平均池化操作,(MaxPool(F))为对输入特征图的最大池化操作,“;”表示特征拼接。
与通道注意力模块(CAM)、卷积块注意力模块(CBAM)等其他注意力机制(需结合通道注意力和空间注意力)不同,SAM模块仅聚焦于空间上下文信息:通过对输入图像进行最大池化和平均池化操作,理解空间上下文特征,生成二维注意力图,从而确定输入特征中更具意义的区域(Cao等人,2023)。这一特性使SAM模块能让模型仅关注复杂背景图像中的有效区域,既降低噪声干扰,又优化计算量。此外,SAM模块无需像其他注意力机制那样对通道信息进行高成本计算,因此是一种轻量化、快速处理的解决方案。
2.5.2 直方图均衡化(HE)
HE是一种用于提升图像对比度的图像处理技术(Li等人,2022)。通过改变图像中像素的灰度分布,HE可增强图像的对比度和细节,使图像整体更清晰、更鲜明。由于HE能使像素值在更大范围内分布,从而呈现更明显的特征模式和细节,因此可提升深度学习模型的性能(Wang等人,2021)。
2.5.3 小波变换(WT)
在图像处理应用中,WT是一种基于频域的滤波技术(Chaudhary和Agrawal,2021),在信号去噪、压缩等信号处理应用中效果显著。WT可提供频率信息对应的时间和空间位置细节,在深度学习模型训练前,通过WT去除图像噪声,可减少无关信息的干扰,从而帮助提升模型性能(Cengiz等人,2022)。
3 实验结果与分析
本研究开发的模型所获结果,将从“性能指标”“UP-YOLO结果”“PP-YOLO结果”三个核心部分进行呈现:
- “性能指标”部分:介绍用于评估模型性能的变量,给出所用参数及指标计算公式;
- “UP-YOLO结果”和“PP-YOLO结果”部分:分别呈现基于UP-YOLO和PP-YOLO方案训练模型所获的结果。
3.1 性能指标
本研究采用式(3)~式(6)计算的F1分数(F1 Score)、准确率(Accuracy)、召回率(Recall)和mAP50值,对训练后的深度学习模型性能进行评估与分析。分析公式可知,模型性能主要取决于真阳性(TP)、假阳性(FP)和假阴性(FN)三个参数。
在衡量模型性能的指标中,F1分数在深度学习模型中应用广泛,其计算方式为精确率(Precision)和召回率的调和平均数(Takahashi等人,2022)。mAP(平均精度均值)是另一常用性能指标,用于衡量模型对目标的检测精度,同时反映模型对类别预测的准确性(精确率)和对类别中目标的覆盖程度(召回率)。
mAP50是指采用50%交并比(IoU)阈值计算的平均精度(AP)的均值。IoU用于衡量模型预测的边界框与真实边界框的重合程度,通过区分真阳性和假阳性,优化损失函数,同时也是mAP等目标检测性能指标的核心计算依据。
相关计算公式如下:
- 精确率(Precision):
[
\text{Precision} = \frac{TP}{TP + FP}
] - 召回率(Recall):
[
\text{Recall} = \frac{TP}{TP + FN}
] - F1分数(F1 Score):
[
\text{F1 Score} = \frac{2 × \text{Precision} × \text{Recall}}{\text{Precision} + \text{Recall}} \quad (3)
] - 平均精度均值(mAP):
[
\text{mAP} = \frac{1}{n} \sum_{k=1}^{k=n} AP_{k} \quad (6)
]
式中:(TP)为真阳性(模型正确检测到的目标数量),(FP)为假阳性(模型误判为目标的非目标数量),(FN)为假阴性(模型未检测到的真实目标数量),(n)为类别数量,(AP_{k})为第(k)类的平均精度。
3.2 UP-YOLO结果
UP-YOLO方案中,不对数据集进行任何预处理,直接采用YOLOv5、YOLOv8、YOLOv9模型进行训练,旨在探究轮次、训练-测试比例等超参数变化对模型性能指标的影响。图6详细对比了基于UP-YOLO训练的各模型性能。
以F1分数为参考指标,确定UP-YOLO方案中性能最优的模型:在70%训练-30%测试比例、50轮次的训练条件下,YOLOv8l模型的F1分数最高,达到94.3%。
不同训练-测试比例和不同轮次下,基于UP-YOLO训练的各模型的边界框损失(box loss)、类别损失(cls loss)和分布焦点损失(dfl loss)曲线如图7所示。分析曲线可知,从训练开始到最后一轮次,损失曲线均呈持续下降趋势。
混淆矩阵也可用于评估深度学习模型的性能。在70%训练-30%测试比例、50轮次的条件下,YOLOv8l模型的混淆矩阵结果显示:真阳性(TP)、假阴性(FN)、假阳性(FP)、真阴性(TN)值分别为0.94、0.08、0.03、0.95。通过混淆矩阵可计算出模型的精确率、召回率和F1分数:分析结果显示,该模型的精确率为96.5%,召回率为92.2%,F1分数为94.3%。
基于UP-YOLO开发的YOLOv8l模型在不同樱桃树和苹果树样本上的测试结果如图8所示。图像分析表明,该模型对樱桃树和苹果树的分类与检测准确率较高。
(注:图6~图8为UP-YOLO结果的核心图表,中文标注如下:
- 图6:基于未优化YOLO(UP-YOLO)开发的人工智能模型性能值(原始樱桃树和苹果树数据集)
(包含4个子图:左上为“50-100-150轮次F1分数(70-30%训练-测试比例)”,横轴为模型类型(YOLOv5s/YOLOv5m/YOLOv5l/YOLOv8s/YOLOv8m/YOLOv8l/YOLOv9c),纵轴为F1分数(0.900.95);右上为“50-100-150轮次mAP50(70-30%训练-测试比例)”,纵轴为mAP50(0.920.98);左下为“50-100-150轮次F1分数(80-20%训练-测试比例)”;右下为“50-100-150轮次mAP50(80-20%训练-测试比例)”,各子图中不同轮次的性能值以不同曲线或数据点标注) - 图7:UP-YOLO损失曲线
(包含3个子图:a)边界框损失(box loss)曲线,b)类别损失(cls loss)曲线,c)分布焦点损失(dfl loss)曲线,横轴均为轮次(25、50、75、100、125、150),纵轴为损失值(0~2.0),不同训练-测试比例的损失值以不同曲线标注) - 图8:基于UP-YOLO训练的YOLOv8l模型分类结果
(包含多组樱桃树和苹果树的检测图像,每张图像中通过矩形框标注目标,标注框旁标注“Cherry”(樱桃树)或“Apple”(苹果树)及置信度,如“Cherry 0.98”表示樱桃树置信度98%))
3.3 PP-YOLO结果
针对UP-YOLO中F1分数最高的YOLOv8模型,应用图像尺寸调整、SAM模块插入、HE和WT预处理技术,对模型进行优化后重新训练。基于PP-YOLO训练的模型性能值详细如图9和图10所示。
实验结果显示,性能最优的模型为:在80%训练-20%测试比例、100轮次的条件下,基于PP-YOLO训练的YOLOv8m模型,其F1分数最高,达到95.8%。
不同训练-测试比例和不同轮次下,基于PP-YOLO训练的各模型的边界框损失、类别损失和分布焦点损失曲线如图11所示。分析曲线可知,从训练开始到最后一轮次,损失曲线均呈持续下降趋势。
在80%训练-20%测试比例、100轮次的超参数条件下,YOLOv8m模型的混淆矩阵结果显示:真阳性(TP)、假阴性(FN)、假阳性(FP)、真阴性(TN)值分别为0.94、0.06、0.02、0.98。通过混淆矩阵可计算模型的精确率、召回率和F1分数:分析结果显示,该模型的精确率为97.8%,召回率为93.9%,F1分数为95.8%。
基于PP-YOLO开发的F1分数最高(95.8%)的YOLOv8m模型,从第一轮次到最后一轮次的性能曲线如图12所示。
该YOLOv8m模型在不同樱桃树和苹果树样本上的测试结果如图13所示。图像分析表明,该模型对樱桃树和苹果树的分类与检测准确率较高。
模型中集成SAM模块,与加入HE、WT预处理技术类似,均在多个性能指标上实现了显著提升。表3呈现了应用这些方法所获的结果,清晰展示了各方法对所提模型性能提升的贡献(表格选取各模型中性能最优的结果)。此外,表3还对比了HE、WT预处理技术与SAM模块单独集成和联合集成时模型的性能。
UP-YOLO模型未进行任何处理时,F1分数为94.3%(详情见表3);对UP-YOLO模型应用HE、WT图像预处理技术和图像尺寸调整后,F1分数提升至95.2%(结果见表3.b);而对集成了SAM模块的PP-YOLO模型应用上述方法后,F1分数达到95.8%(结果见表3.c)。详细分析可知,HE、WT预处理技术和图像尺寸调整使F1分数提升了0.9%,SAM模块则使F1分数进一步提升了0.6%。
(注:图9~图13、表3为PP-YOLO结果的核心图表/表格,中文标注如下:
- 图9:基于优化预处理YOLO(PP-YOLO)开发的人工智能模型性能值(经HE预处理的樱桃树和苹果树数据集)
(包含4个子图,结构与图6一致,分别为“50-100-150轮次F1分数(70-30%训练-测试比例)”“50-100-150轮次mAP50(70-30%训练-测试比例)”“50-100-150轮次F1分数(80-20%训练-测试比例)”“50-100-150轮次mAP50(80-20%训练-测试比例)”,横轴为模型类型(YOLOv8s/YOLOv8m/YOLOv8l),纵轴范围与图6一致) - 图10:基于优化预处理YOLO(PP-YOLO)开发的人工智能模型性能值(经高斯+WT预处理的樱桃树和苹果树数据集)
(结构与图9一致,数据集为经高斯加噪后WT去噪的图像) - 图11:PP-YOLO损失曲线
(包含3个子图,结构与图7一致:a)边界框损失曲线,b)类别损失曲线,c)分布焦点损失曲线,横轴为轮次,纵轴为损失值) - 图12:基于PP-YOLO开发的F1分数最高的YOLOv8m模型(100轮次,高斯+WT数据集)性能曲线
(横轴为轮次,纵轴包含F1分数、mAP50等指标,曲线显示各指标随轮次的提升趋势) - 图13:基于PP-YOLO训练的YOLOv8m模型分类结果
(结构与图8一致,标注框旁标注目标类别及置信度,如“Apple 0.97”表示苹果树置信度97%) - 表3 所提方法中,预处理技术与SAM模块对模型性能提升的代表性结果
(表格分为b)、c)两部分:
b)对UP-YOLO数据集应用HE、WT预处理及图像尺寸调整后的代表性性能结果
(包含“70%训练-30%测试+WT”“80%训练-20%测试+WT”等场景,列出YOLOv8s/YOLOv8m模型在50/100/150轮次下的精确率、召回率、F1分数、mAP50等指标,如YOLOv8m在150轮次下F1分数为95.2%)
c)对UP-YOLO数据集应用HE、WT预处理、图像尺寸调整及SAM模块后的代表性性能结果(PP-YOLO)
(场景与b)一致,指标更优,如YOLOv8m在100轮次、80%训练-20%测试+WT场景下F1分数为95.8%,mAP50为98.3%))
4 讨论
本节围绕两个核心方向展开讨论:首先,通过对比所提方案,分析并评估实验结果;其次,结合所提方法的实验结果,与文献中相关研究进行对比(如表4所示)。讨论过程中,将详细涵盖“无预处理的研究”“含预处理的研究”“含注意力模块的研究”三类,并对比不同目标检测算法与所提方法的性能。
本研究中,UP-YOLO模型在樱桃树和苹果树检测任务中F1分数达到94.3%。尽管UP-YOLO方案中包含YOLOv9等更新的模型,但YOLOv8模型的性能最优。采用PP-YOLO模型后,F1分数提升至95.8%,较UP-YOLO提升1.5%。在PP-YOLO模型的开发过程中,HE、WT预处理技术和图像尺寸调整方法使F1分数提升0.9%;其中,在两种图像预处理技术中,WT较HE更具优势,使性能额外提升0.5%。此外,PP-YOLO模型中加入SAM模块后,F1分数进一步提升0.6%,但相较于预处理技术,SAM模块的性能提升效果较为有限。
4.1 无预处理的研究
Mazzia等人(2020)和Fu等人(2020)分别采用YOLOv3-tiny和Faster R-CNN模型进行苹果果实和苹果树检测,未应用预处理技术,其性能结果分别为83.64%和91.1%,均低于本研究中无预处理的UP-YOLO模型(94.3%);此外,这两项研究仅聚焦于单一目标检测,且采用的深度学习模型较陈旧。
类似地,Cheng等人(2020)和Özer等人(2022)分别采用XGBoost和YOLOv5模型,通过无人机图像进行果园树木检测,均未使用预处理技术,F1分数处于84.3%~98%区间。尽管他们采用了较新的深度学习模型,但由于仅聚焦于单一作物检测,其性能结果仍低于或接近本研究的UP-YOLO模型。
Cheng等人(2021)采用条件随机场(CRF)分割模型进行樱桃树检测(该模型在敏感农药应用的目标检测中应用较少),未应用预处理技术,仅樱桃树检测的性能就比本研究低约3%。Htet等人(2020)采用支持向量机(SVM)算法分析草莓叶片并检测缺素情况,未使用预处理方法,其健康叶片检测准确率比本研究低11%。
4.2 含预处理的研究
Mojaravscki等人(2024)和Bao等人(2024)分别采用YOLOv7和YOLOv5模型检测橄榄果实病害和小麦植株病害,仅在模型中集成HE图像预处理技术,单一作物检测的性能比本研究低约17%。
Ling等人(2024)为实现枣树树干检测,在YOLOv8模型中集成对比度受限自适应直方图均衡化(CLAHE)预处理技术(一种进阶的HE技术),但其成功率为91%,仍低于本研究的PP-YOLO模型(95.8%)。
Akdoğan等人(2024)通过无人机图像检测樱桃树,在YOLOv5模型中集成WT和HE预处理技术,其F1分数与本研究的PP-YOLO模型接近,但该研究仅聚焦于樱桃树单一树种检测。
Wang等人(2015)采用前馈神经网络(FNN)模型(而非当前主流的深度学习模型)检测18种不同水果,在模型中集成基于WT的小波熵(WE)和非常规主成分分析(PCA)预处理技术,其成功率比本研究低6.3%。
Han等人(2022)采用YOLOv5模型并仅使用泛洪填充预处理技术检测樱桃果实品质,尽管仅聚焦于单一目标检测,但其性能提升幅度(约3.8%)仍低于本研究中预处理技术的提升幅度(0.9%)与SAM模块的叠加效果(总计1.5%)。
4.3 含注意力模块的研究
Cheng等人(2023)选用MobileNetv2作为骨干网络的DeepLabv3架构(用于语义分割的架构)进行樱桃树序列检测,在MobileNetv3骨干网络中加入CBAM注意力模块,仅使单一目标检测的F1分数提升1%;尽管他们使用的数据集规模与本研究相近,但其性能仍比本研究的PP-YOLO模型低约4%。
Yu等人(2022)开发了一种基于语义分割的模型FcsNet,用于谷物病虫害检测,在模型中集成CAM、SAM、频域注意力(FAM)三种注意力机制及WT预处理技术;尽管该研究使用了大规模数据集,但应用这些方法后性能仅提升3%。而本研究采用的YOLO架构具有速度快、参数少的特点,更适用于实时目标检测导向的应用场景。
Li和Wu(2022)为实现小麦穗部检测与计数,在YOLOv5模型中集成CBAM注意力模块,仅使小麦穗部检测的F1分数提升3.7%。Tang等人(2023)为实现李子果实的精准检测与计数(以保护果实免受病害影响),在YOLOv7模型中集成CBAM模块,提出YOLOv7-plum模型,其准确率为94.91%,性能仅提升约2%,低于本研究PP-YOLO模型的提升幅度(1.5%)与基础性能(95.8%)。
Wang等人(2022)指出,黄花刺茄杂草会损害农业区域的作物并降低产量,因此在YOLOv5模型中集成CBAM注意力模块,使F1分数提升2.6%以实现对该杂草的检测。可见,在单一目标检测问题中,注意力模块对性能提升的贡献显著;而本研究中,尽管采用的SAM模块相对基础,但集成后仍使F1分数提升0.6%。未来可进一步评估CAM、CBAM等更复杂的注意力模块,以提升注意力机制的效果。
表4 所提方法与文献中相关研究的对比
| 参考文献(Reference) | 问题定义(Problem definition) | 架构(Architecture) | 数据集规模(Dataset) | 结果(准确率/性能指标)(Result) | 所用预处理方法(Used Pre-processing Methods) |
|---|---|---|---|---|---|
| Mazzia等人(2020) | 苹果果实检测 | YOLOv3-tiny | 618 | 83.64%(准确率) | 无 |
| Fu等人(2020) | 苹果树检测 | Faster R-CNN | 800 | 91.1%(平均精度) | 无 |
| Cheng等人(2020) | 基于无人机的樱桃树与苹果树识别 | XGBoost | 875 | 84.3%(准确率,IoU=88%) | 无 |
| Özer等人(2022) | 基于无人机的樱桃树检测 | YOLOv5 | 889 | 98%(F1分数) | 无 |
| Cheng等人(2021) | 樱桃树检测 | CRF(条件随机场) | 500 | 93.3%(准确率) | 无 |
| Htet等人(2020) | 草莓叶片分析与缺素检测 | SVM(支持向量机) | 641 | 84.91%(准确率) | 无 |
| Mojaravscki等人(2024) | 农业区域日光下橄榄果实检测 | YOLOv7 | 2580 | 72.9%(F1分数) | HE、色卡校正 |
| Bao等人(2024) | 小麦植株病害检测 | YOLOv5 | 1300 | 73.8%(F1分数) | HE |
| Ling等人(2024) | 枣树树干检测 | YOLOv8 | - | 91%(准确率) | CLAHE(对比度受限自适应直方图均衡化) |
| Akdoğan等人(2024) | 基于无人机的樱桃树检测与喷洒 | YOLOv5 | 889 | 98.6%(F1分数) | HE、WT |
| Wang等人(2015) | 水果检测 | FNN(前馈神经网络) | 1653 | 89.5%(准确率) | WE(小波熵)+ PCA(主成分分析) |
| Han等人(2022) | 樱桃果实品质检测 | YOLOv5 | 400 | 99.6%(准确率,含泛洪填充) | 泛洪填充 |
| Cheng等人(2023) | 樱桃果实检测 | DeepLabv3 + CBAM | 2168 | 95.87%(准确率) | 无 |
| Yu等人(2022) | 谷物病虫害检测 | FcsNet(CAM + FAM + SAM) | 1082 | 98.16%(准确率) | DWT(离散小波变换) |
| Li和Wu(2022) | 小麦穗部检测与计数 | YOLOv5 + CBAM | 3376 | 93%(准确率) | 无 |
| Tang等人(2023) | 李子果实检测与计数 | YOLOv7-plum + CBAM | 1220 | 94.91%(准确率) | 无 |
| Wang等人(2022) | 黄花刺茄杂草检测 | YOLOv5 + CBAM | 3123 | 92.3%(F1分数) | 无 |
| 本研究(Proposed Method) | 基于无人机的樱桃树与苹果树检测(PP-YOLO) | YOLOv8 + SAM | 3600 | 95.8%(F1分数)、98.3%(mAP50) | WT、HE |
5 深度学习模型的优势、劣势与挑战
本节从“优势”“劣势”“挑战”三个子方向,分析并讨论所开发深度学习模型的特性,同时阐述模型实施过程中遇到的问题,以及模型的整体性能和实际适用性。
5.1 所提方法的优势
- 高质量数据集构建:对采集的图像进行误差清洗,确保数据满足训练要求;通过应用翻转和饱和度数据增强方法,构建了包含3600张图像的独特数据集,为模型训练提供充足数据支撑。
- 先进模型设计:开发了UP-YOLO和PP-YOLO两种深度学习模型,融合了图像预处理技术、图像尺寸调整、注意力机制等当前主流方法,确保模型性能的先进性。
- 文献贡献:所开发的原创深度学习模型在方法学层面可为现有文献提供补充,丰富农业领域目标检测的研究思路。
- 复杂环境适应性:通过对模型应用HE、WT等图像预处理技术,显著提升了模型在强光、复杂环境下的树种检测性能;图像尺寸调整使模型以标准化格式接收输入数据,优化了特征提取环节,进而提升树木检测准确率。
- 注意力机制增效:SAM注意力模块的应用,使模型能更好地学习树木结构中的枝干和叶片特征,增强了模型对环境变化的适应能力,提升了整体准确率。
- 性能验证充分:通过详细对比UP-YOLO和PP-YOLO模型的F1分数、mAP50、准确率、灵敏度等指标,明确模型的优势特征——其中,PP-YOLO中经WT预处理的图像检测F1分数最高,达到95.8%。实验结果表明,所测试的人工智能模型在樱桃树和苹果树检测中性能优异,可集成于现有农业无人机系统。
5.2 所提方法的劣势
- YOLO模型固有局限:尽管YOLO模型当前应用广泛且备受青睐,但存在过拟合、泛化能力不足、对环境条件敏感、多尺度目标和小目标检测性能较差等固有劣势。本研究虽采用数据增强技术降低过拟合风险,但通过扩大数据集规模、引入更多样的数据增强技术,可进一步降低过拟合风险。
- 数据集局限性:所开发的深度学习模型主要面向喷洒无人机的俯视视角树木检测,因此数据集仅包含樱桃树和苹果树图像。若检测场景中出现数据集中未涵盖的不可预测目标,模型易产生误检——未来需扩大数据集,纳入更多类型的目标或树木图像,以突破模型的应用局限。
- 飞行高度限制:本研究假设无人机飞行高度不超过树木上方5米,但在更高高度的应用场景中,树木在图像中尺寸变小,且视野中可能出现不同尺寸的目标,导致树木检测难度增加。因此,模型在俯视视角下对小尺寸、变尺寸目标的检测能力仍有不足,需进一步优化。
- 超参数优化不足:批量大小、学习率、权重衰减等超参数的合理选择,是模型性能指标达标的关键。超参数最优组合的确定可通过人工调整或贝叶斯优化、随机搜索等优化方法,以及Optuna、Raytune等开发工具实现,但本研究在模型超参数的最优配置方面仍有提升空间。
- 环境适应性有限:本研究未考虑阴天、大风等天气条件的影响,因此不同天气导致的图像质量变化,以及无人机可能面临的飞行稳定性问题,均是研究的潜在局限。
5.3 所提方法的挑战
在数据集构建、模型开发与测试过程中,本研究面临以下挑战:
- 树种分类难度:樱桃树与苹果树的形态特征(如形状、颜色)相似,导致两类树木的分类检测存在一定难度。
- 数据质量与成本平衡:模型检测准确率的提升依赖于数据集的图像质量和数据量,而多光谱相机采集的图像可提升樱桃树和苹果树检测的准确性,但多光谱相机成本较高——因此,本研究需聚焦于低成本RGB图像的检测方案,以平衡检测性能与成本。
- 数据集稀缺性:互联网上缺乏樱桃树和苹果树的高分辨率俯视图像,因此需自主构建完整数据集。本研究通过大疆御Air无人机采集果园图像,对构建的数据集进行图像提取、增强和编辑,使其满足训练要求。
- 预处理技术兼容性:在对数据集应用图像预处理技术时,预处理函数与数据集的兼容性出现问题——通过MATLAB编程构建预处理技术所需的软件函数,获得预处理图像后,需调整函数以适配数据集,确保软件正常运行。
- SAM模块集成问题:在模型中集成SAM函数时,出现误差与兼容性问题,通过多次调试与尝试,最终解决了该问题,确保模块正常工作。
6 结论与未来工作
本研究开发了一种用于樱桃树和苹果树检测的人工智能系统,具体成果如下:
- 数据集构建:通过大疆御Air无人机采集图像,构建了包含3600张樱桃树和苹果树图像的原创数据集;采用翻转和饱和度数据增强方法,扩大数据集规模,为模型训练提供充足数据。
- 模型方案提出:提出UP-YOLO和PP-YOLO两种方案:
- UP-YOLO:分别以50、100、150轮次,80%训练-20%测试和70%训练-30%测试的比例,对YOLOv5、YOLOv8、YOLOv9三种深度学习模型进行训练;
- PP-YOLO:以UP-YOLO中F1分数最高的YOLOv8模型为基础进行优化,对数据集应用WT和HE预处理技术(先向数据加入0.3强度的高斯噪声,再通过WT去噪),将YOLOv8模型的默认图像尺寸(640×640)调整为800×800,并加入SAM模块,以提升模型对树木叶片和枝干结构的学习精度。
- 实验结果:
- UP-YOLO:在70%训练-30%测试比例、50轮次条件下,YOLOv8l模型的F1分数最高,达到94.3%;
- PP-YOLO:在80%训练-20%测试比例、100轮次条件下,对图像应用WT预处理的YOLOv8m模型性能最优,F1分数达到95.8%,mAP50达到98.3%,较UP-YOLO分别提升1.5%和1.4%。
未来工作方向
- 模型架构优化:通过调整骨干网络、检测头架构、卷积层及函数等,优化YOLO模型结构,提升模型性能;探索将Transformer结构(如DETR3、Vision Transformer)、通道注意力模块或混合损失函数集成于模型,开发混合深度学习模型。
- 预处理技术创新:单独或组合使用现代图像预处理方法,优化模型对环境的适应性,进一步提升模型性能。
- 模型轻量化:随着实时应用需求的增加,开展模型轻量化研究,降低模型成本,提升其在实时平台上的运行速度。
- 超参数优化:超参数优化是模型性能提升的关键方向,未来可采用贝叶斯优化、随机搜索等优化技术,或Optuna、Raytune等开发工具,实现超参数的精准优化。
更多推荐


所有评论(0)