💡💡💡本文核心贡献如下:

  1. 首次系统基准测试:首次系统评估了四种数据增强设置(NAS、GAS、GMAS、DAS)在YOLO26五种模型尺寸变体上对TEM图像腺病毒检测的影响,填补了该领域研究空白。

  2. 确定最佳组合:经验性地发现YOLO26n与GAS的组合在检测精度(mAP@50–95: 0.44)、收敛稳定性和计算效率之间实现了最佳平衡。

  3. 揭示模型尺寸与性能的非线性关系:实验表明增大模型尺寸并不必然提升检测性能,小型变体(YOLO26n)反而表现最优,为资源受限场景下的模型选型提供了依据。

  4. 提供可复现基准:提供了系统化的实验框架和公开代码,为未来TEM病毒检测研究建立了可比较的基准。

      博主简介

AI小怪兽 | 计算机视觉布道者 | 视觉检测领域创新者

深耕计算机视觉与深度学习领域,专注于目标检测前沿技术的探索与突破。长期致力于YOLO系列算法的结构性创新、性能极限优化与工业级落地实践,旨在打通从学术研究到产业应用的最后一公里。

🚀 核心专长与技术创新

  • YOLO算法结构性创新:于CSDN平台原创发布《YOLO26魔术师》、《YOLO11魔术师》等全系列深度专栏。系统性提出并开源了多项原创自研模块,在模型轻量化设计、多维度注意力机制融合、特征金字塔重构等关键方向完成了一系列突破性实践,为行业提供了具备高参考价值的技术路径与完整解决方案。

  • 技术生态建设与知识传播:独立运营 “计算机视觉大作战” 公众号(粉丝2.3万),成功构建高质量的技术交流社群。致力于将复杂算法转化为通俗易懂的解读与可复现的工程代码,显著降低了计算机视觉的技术入门门槛。

🏆 行业影响力与商业实践

  • 荣获腾讯云年度影响力作者创作之星奖项,内容质量与专业性获行业权威平台认证。

  • 全网累计拥有 7万+ 垂直领域技术受众,专栏文章总阅读量突破百万,在目标检测领域形成了广泛的学术与工业影响力。

  • 具备丰富的企业级项目交付经验,曾为工业视觉检测、智慧城市安防等多个关键领域提供定制化的算法模型与解决方案,驱动业务智能化升级。

💡 未来方向与使命

秉持 “让每一行代码都有温度” 的技术理念,未来将持续聚焦于实时检测、语义分割及工业缺陷检测的商业化闭环等核心方向。愿与业界同仁协同创新,共同推动技术边界,以坚实的技术能力赋能实体经济与行业变革。

 原创自研系列, 26年计算机视觉顶会创新点

《YOLO26魔术师》

 原创自研系列, 25年计算机视觉顶会创新点

《YOLOv13魔术师》

《YOLOv12魔术师》

《YOLO11魔术师》

《YOLOv8原创自研》

《YOLOv5原创自研》

《YOLOv7原创自研》

《YOLOv9魔术师》

​《YOLOv10魔术师》 ​

应用系列篇:

《YOLO小目标检测》

《深度学习工业缺陷检测》

《YOLOv8-Pose关键点检测》

23、24年最火系列,加入24年改进点内涵100+优化改进篇,涨点小能手,助力科研,好评率极高

《YOLOv8魔术师》

 《YOLOv7魔术师》

《YOLOv5/YOLOv7魔术师》

《RT-DETR魔术师》

0.原理介绍


摘要: 本研究系统性地对 YOLO26 不同模型尺寸变体上的多种数据增强设置进行了基准测试,以确定用于 TEM 图像中腺病毒检测的最有效配置。所测试的增强设置包括 NAS、GAS、GMAS 和 DAS,所有设置均在相同的训练条件下进行评估。腺病毒数据集选自已发表的 TEM 病毒数据集,通过利用腺病毒粒子位置重新标注,生成了与 YOLO 兼容的边界框标注。实验结果表明,所测试的数据增强设置在 YOLO26 上进行腺病毒检测时具有不同的影响,并指出了最有效的数据增强配置。

论文:2607.17799

1. 引言

透射电子显微镜仍然是直接可视化腺病毒的最可靠技术之一,因为用于基因治疗的病毒载体的大规模生产需要表征此类病毒颗粒的工具[1-2]。由于 TEM 能够实现纳米级分辨率,因此可以了解当参数或工艺操作发生变化或制剂被修改时病毒颗粒会发生什么[3-4]。然而,由于破损腺病毒、碎片和各种染色伪影的存在,在 TEM 图像中准确检测腺病毒仍然具有挑战性[4]。深度学习方法已展现出自动化腺病毒检测的强大潜力[3–4]。然而,尽管基于 YOLO 的检测器在许多目标检测任务中取得了成功[5],但其在腺病毒检测中的应用此前尚未被研究。最近,YOLO26 作为 YOLO 家族的最新成员被引入[6],为研究其在从 TEM 病毒数据集[7]的 TEM 图像中检测腺病毒的适用性提供了机会。尽管目标检测架构取得了进步[8-12],但数据增强设置对使用 YOLO26 进行腺病毒检测的影响或作用在很大程度上仍未被探索。在本研究中,数据增强设置被定义为预定义的一组数据增强变换及其相应的参数设置,这些变换应用于训练图像(在 YOLO26 模型训练期间)。由于数据增强设置可以显著影响目标检测模型的泛化能力,因此确定最有效的增强设置对于在 TEM 图像中进行可靠的腺病毒检测至关重要,特别是由于此类 TEM 图像中同时存在完整的腺病毒、破损的腺病毒、不同类型的碎片和各种染色伪影[4]。因此,本工作系统地对比了多种数据增强设置在 YOLO26 模型变体上的表现,以确定用于腺病毒检测的最有效增强配置。所对比的数据增强设置包括无增强设置、几何增强设置、几何+马赛克增强设置和默认增强设置。选定的 YOLO26 模型尺寸变体为 nano、small、medium、large 和 extra-large [6]。本工作的贡献有两个方面:设计数据增强设置并进行系统基准测试;经验性地确定在 YOLO26 模型尺寸变体上用于 TEM 图像中腺病毒检测的最有效配置。

2. 材料与方法

2.1. 数据增强设置

在深度学习中,数据增强依赖于几何变换、非几何变换和复合变换或多图像合成方法。最流行的是几何变换,它严重依赖插值算法来估计变换坐标处的像素值,以在空间变换后保持图像连续性。早期研究从一般角度研究了图像插值,建立了对灰度插值方法的广泛理解[16]。随后研究考察了舍入函数对插值精度的影响,表明插值性能可能受到舍入策略选择的显著影响[17–19]。后来引入了一个新的概念框架,将插值算法分类为额外像素和非额外像素方法[20]。基于这些发现,后续研究专注于通过自适应优化、新颖的加权方案和外推技术来开发改进的插值算法[21–26]。这些发展最终被扩展到实际的医学成像应用中,其中优化的插值被用于改善超声心动图扫描转换[19,27]。在此背景下,插值算法在深度学习方法所使用的数据增强流程中发挥着基础性作用。时至今日,最近邻、双线性和双三次插值仍然是在数据增强期间对图像进行几何变换时最常用的插值算法之一[13]。然而,插值器的选择仍然取决于图像类型和/或预期应用[13]。表 1 总结了本研究中评估的数据增强设置。所评估的设置及其相关参数值被系统地选择,以隔离不同增强选项的贡献,同时保持实验设计可控。无增强设置作为无增强的基线。几何增强设置引入了常用几何变换单独的效果,而几何+马赛克增强设置在马赛克增强的基础上增加了额外的贡献,超越了几何变换。最后,默认增强设置允许与 YOLO26 中实现的默认数据增强进行比较。

2.2. YOLO26 模型尺寸变体

YOLO26 模型系列包含五种尺寸变体:nano、small、medium、large 和 extra-large [6]。这些变体共享相同的底层架构和训练框架,但模型容量和计算复杂度不同。所有五种变体都支持相同的计算机视觉任务,包括目标检测、实例分割、图像分类、姿态估计和旋转目标检测[6]。多种模型尺寸的可用性使得能够在不同的计算预算下进行评估,同时保持一致的设计。在本研究中,所有五种 YOLO26 模型尺寸变体都使用相同的实验设置进行训练和评估,以系统评估它们对腺病毒检测的适用性[28]。

2.3. TEM 病毒数据集

TEM 病毒数据集总共包含 22 种病毒类别的 1245 张图像,这些图像使用两种不同的电子显微镜拍摄:一台配备 Morada 相机的 LEO 显微镜和一台配备 MegaView III 相机的 Tecnai 10 显微镜[7]。数据集中病毒类别在图像数量(从 9 到 129)和病毒颗粒数量(从 38 到 1934)方面都严重不平衡。所有原始图像的尺寸为 1376×1032 或 2048×2048 像素,但像素大小从 0.26 到 5.57 nm 不等,即它们是在不同放大倍数下采集的[7]。每个病毒颗粒仅以其近似中心进行标注,即对于孤立的球形颗粒为一个单点,对于聚集病毒或细长病毒则为中心线。标注以坐标点的形式存储,每个图像对应一个单独的文本文件[7]。尽管已发表的 TEM 病毒数据集包含 22 种病毒类别,但本研究仅使用了腺病毒类别。原始腺病毒数据集包括训练集、测试集和验证集[3, 7]。

2.4. 计算环境

所有训练实验均在由利莫瑞克大学管理的 SLURM 管理的高性能计算集群上进行,该集群配备 NVIDIA A100 SXM4-40GB GPU。GPU 资源利用率和系统性能使用 NVIDIA 的 nvidia-smi 工具进行监控,该工具在整个训练和推理阶段提供 GPU 内存使用、处理负载、温度、功耗、CUDA 环境和活动计算进程的实时统计信息。实验期间未使用额外的环境模块或容器化运行时。训练和评估脚本使用 Python 开发,并通过 Zenodo 存储库公开提供[28]。

2.5. 标注

标注边界框是从 TEM 腺病毒数据集中提供的腺病毒粒子中心坐标生成的。由于原始标注仅包含粒子中心坐标[7],因此开发了一个自定义 Python 脚本来自动生成与 YOLO 兼容的标注文件[29]。对于每个标注的粒子,脚本创建了一个以记录的粒子位置为中心的固定大小的边界框。基于在 TEM 图像中观察到的腺病毒粒子的近似大小,经验性地选择了 60×60 像素的边界框大小。超出图像边界的边界框在转换为归一化的 YOLO 标注格式之前被自动裁剪以保持在图像限制内。此外,该脚本还生成了可视化图像,以便于对自动生成的标注进行视觉验证[29]。

2.6. 评估指标

腺病毒检测性能使用精确率、召回率、mAP@50 和 mAP@50–95 进行定量评估。精确率强调减少假阳性,而召回率强调减少假阴性[30]。mAP@50 指标表示在交并比阈值为 0.50 时计算的平均精度均值,而 mAP@50–95 表示在 0.50 到 0.95 之间以 0.05 为步长的十个 IoU 阈值上平均的平均精度均值[31]。

3. 结果

实验结果分为四个小节:(i) 定量检测,(ii) 训练和推理时间,(iii) YOLO26n 收敛分析,以及 (iv) 定性检测。

3.1. 定量检测

表 2 展示了测试集上的腺病毒检测性能。此处,使用 mAP@50–95、mAP@50、精确率和召回率指标评估了五种 YOLO26 尺寸变体和四种评估的数据增强设置。如表 3 所示,使用 GAS 训练的 YOLO26n 取得了最高的整体检测精度,mAP@50–95 为 0.44,mAP@50 为 0.69,精确率为 0.86。然而,最高的召回率 0.65 是使用 DAS 获得的。增强的效果在不同模型尺寸变体上有所不同。GAS 对 YOLO26n 最有效,而 GMAS 对 YOLO26m、YOLO26l 和 YOLO26x 产生了最高的 mAP@50 值。NAS 对 YOLO26s、YOLO26m 和 YOLO26l 产生了最高的 mAP@50–95,而 YOLO26x 使用 NAS 和 DAS 都获得了相同的最高 mAP@50–95 值 0.39。总体而言,增加模型尺寸并未带来检测性能的相应提升,因为 nano 变体在实验中普遍取得了最高值。

3.2. 训练和推理时间

表 3 比较了五种 YOLO26 尺寸变体在四种评估的数据增强设置下的训练和推理时间。正如预期的那样,训练和推理时间通常随模型尺寸的增加而增加,YOLO26n 需要的执行时间最短,而 YOLO26x 最长。数据增强设置对计算时间的影响在所评估的模型中不太一致。与 DAS 和 NAS 相比,GAS 和 GMAS 通常减少了训练时间。例如,YOLO26x 使用 DAS 训练需要 29.31 分钟,而 GMAS 将训练时间减少到 20.59 分钟。相比之下,对于给定的模型变体,推理时间在不同增强设置下仅表现出微小变化。总体而言,模型尺寸对推理时间的影响远大于数据增强设置的选择。

3.3. YOLO26n 收敛分析

选择 YOLO26n 进行收敛分析,因为它在评估的 YOLO26 模型尺寸变体中取得了最高的整体腺病毒检测性能。图 1 展示了 YOLO26n 在四种评估的数据增强设置下的训练收敛情况。如图 1 所示,所有四种增强设置在训练期间都表现出稳定的收敛,训练和分类损失在早期 epochs 迅速下降,然后逐渐稳定。类似地,精确率、召回率、mAP@50 和 mAP@50–95 在训练开始时急剧上升,并随着训练的进行接近相对稳定的值。在这些数据增强设置中,GAS 在整个训练过程中保持了稳定的收敛曲线。相比之下,GMAS 在验证损失和检测指标上表现出较大的波动,特别是 mAP@50–95,表明收敛相对不太稳定。总体而言,收敛曲线证明了所有增强设置的成功,尽管在收敛稳定性和最终检测性能方面观察到了差异。

3.4. 定性检测

图 2 展示了代表性的定性腺病毒检测结果。这些结果是 YOLO26n 在四种数据增强设置下仅在四张 TEM 测试图像上取得的。在这四个图像示例中,与检测到的腺病毒粒子相关的置信度分数为:DAS 为 0.9、0.9、0.8、0.1、0.9、0.7、0.3、0.9 和 0.0;NAS 为 1.0、0.4、0.7、1.0、0.9、0.9、0.8、0.6 和 0.6;GAS 为 0.9、0.9、0.4、0.9、0.9、0.8、0.3、0.9 和 0.9;GMAS 为 0.4、0.4、0.3、0.3、0.7、0.5、0.5、0.4 和 0.5。此处,NAS 和 GAS 表现出最高的平均置信度分数,其次是 DAS,而 GMAS 产生的平均置信度分数最低。请注意,这些观察结果特定于图 2 中所示的四张代表性 TEM 图像,仅用于支持定性评估,而不是在整个测试数据集上提供定量比较。

4. 讨论

我们的讨论部分将重点关注数据增强设置的影响、YOLO26 模型尺寸变体的影响、意义、局限性和未来工作。

4.1. 数据增强设置的影响

GAS 的优越性能表明几何变换提高了模型学习腺病毒粒子外观变化的能力,同时保持了逼真的图像内容。相比之下,马赛克变换的添加并未持续改善检测性能,并且与不太稳定的收敛和较低的定性置信度相关联。这可能表明将多张 TEM 图像组合成一张训练图像会引入不太能代表腺病毒粒子自然外观的图像合成。

4.2. YOLO26 模型尺寸变体的影响

YOLO26n 的优越性能表明,增加模型容量并未为评估的腺病毒数据集提供额外的判别能力。这表明腺病毒粒子的视觉特征可以使用紧凑模型有效学习,并且更大的模型对所评估的腺病毒数据集可能提供的益处有限。

4.3. 实际意义

实验结果表明,实现最优腺病毒检测所需的不是最大的 YOLO26 模型尺寸变体,而是模型尺寸变体和数据增强设置的适当组合。在所评估的数据增强设置中,YOLO26n 和 GAS 的组合在检测精度、收敛稳定性和计算效率之间提供了最有利的平衡。

4.4. 研究局限性与未来工作

由于实验是使用单个腺病毒 TEM 数据集进行的,因此不应假设 GAS 和 YOLO26n 的观察到的优越性可以推广到其他病毒类型或电子显微镜数据集。因此,未来的研究应在其他数据集上验证这些发现,调查是否对其他目标检测架构观察到类似趋势,并评估所对比的数据增强设置对其他病毒类型和 TEM 成像条件的适用性。

5. 结论

本研究系统地对比了四种数据增强设置在五种 YOLO26 模型尺寸变体上的表现,以研究它们对 TEM 图像中腺病毒检测的影响。实验结果表明,在评估的配置中,GAS 与 YOLO26n 的组合在检测精度、收敛稳定性和计算效率之间实现了最有利的整体平衡。研究结果进一步表明,增加 YOLO26 模型尺寸并不一定会提高检测性能,突显了选择模型尺寸变体和数据增强设置的适当组合的重要性,而不是仅依赖更大的模型。总体而言,所提出的基准测试为使用 YOLO26 实现最优腺病毒检测提供了实用指导,并为未来在更大和更多样化的 TEM 数据集上进行评估奠定了基础。

更多推荐