
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在城市广阔且动态的场景中,交通安全描述与分析在从保险检查到事故预防的各种应用中起着关键作用。本文介绍了CityLLaVA,一个针对城市场景设计的视觉语言模型(VLMs)的新颖微调框架。CityLLaVA通过以下方式提升模型的认知和预测准确性:(1) 在训练和测试阶段使用边界框进行最优视觉数据预处理,包括视频最佳视角选择和视觉提示工程;(2) 构建简洁的问答序列并设计文本提示以细化指令理解;(3)
一个典型的数据点包括文本和相应的标签。
在本文中,作者提出了YOLOX-ViT这一新型目标检测模型,并研究了在不牺牲性能的情况下,知识蒸馏对模型尺寸减小的有效性。聚焦于水下机器人领域,作者的研究解决了关于较小模型的可行性以及视觉Transformer层在YOLOX中影响的关键问题。此外,作者引入了一个新的侧扫声纳图像数据集,并使用它来评估作者的目标检测器的性能。结果显示,知识蒸馏有效减少了墙体检测中的误报。另外,引入的视觉Transfo
医学图像的精确自动分割是临床诊断和分析的关键步骤。基于U型结构的卷积神经网络(CNN)方法在许多不同的医学图像分割任务中取得了显着的性能。但是,这种结构存在类别不平衡、边界模糊等问题,使得单级上下文信息提取能力不足。本文提出了一种上下文金字塔融合网络(CPFNet),该网络将两个金字塔模块相结合,融合全局/多尺度上下文信息,在U型结构的基础上,在编码器和解码器之间设计了多个全局金字塔引导模块(GP
现有的开词汇目标检测器通常需要用户预设一组类别,这大大限制了它们的应用场景。在本文中,作者介绍了DetCLIPv3,这是一种高性能检测器,不仅在开词汇目标检测方面表现出色,同时还能为检测到的目标生成分层标签。DetCLIPv3的特点有三个核心设计:多功能的模型架构:作者导出一个健壮的开集检测框架,并通过集成字幕 Head 进一步赋予其生成能力。高信息密度数据:作者开发了一个自动标注 Pipelin
解剖结构和病理的分割本质上是模糊的。例如,结构边界可能不清晰可见,或者不同的专家可能具有不同的注释风格。大多数当前最先进的方法不考虑这种模糊性,而是学习从图像到分割的单个映射。在这项工作中,我们提出了一种新的方法来模拟给定的输入图像的分割的条件概率分布。我们推导出一个层次概率模型,其中单独的潜变量负责在不同的分辨率建模的分割。该模型中的推理可以使用变分自动编码器框架有效地执行。
医学图像分割可以为进一步的临床分析和疾病诊断提供可靠的依据。随着卷积神经网络(CNN)的发展,医学图像分割性能有了显著的提高。然而,大多数现有的基于CNN的方法往往产生不令人满意的分割掩模没有准确的对象边界。这个问题是由有限的上下文信息和连续池化和卷积操作后的不充分的区分特征映射引起的。此外,医学图像的特点是高类内变化,类间不区分和噪声,提取强大的上下文和聚合的细粒度分割的区别性特征仍然具有挑战性
显著目标检测(SOD)在计算机视觉中仍然是一个重要的任务,其应用范围从图像分割到自动驾驶。基于全卷积网络(FCN)的方法在过去几十年里在视觉显著性检测方面取得了显著进展。然而,这些方法在准确检测显著目标方面存在局限性,尤其是在具有多个目标、小目标或低分辨率目标的具有挑战性的场景中。为了解决这个问题,作者提出了一种显著性融合注意力U-Net(SalFAU-Net)模型,该模型在每个解码器块中引入了一
在未来,随着计算机算力的增强、数据规模的扩大以及算法的不断优化,深度学习技术将会在更多领域展现出强大的应用潜力,为人类社会带来更多的便利与进步。它由一个输入层和一个输出层组成,其中每个输入都与输出层的每个神经元相连,具有一定的权重。感知机的输出是输入的加权和经过阈值函数的结果。本文将介绍深度学习的发展历史,从早期的感知机到如今的深度神经网络,同时介绍深度学习中的一些关键技术和公式。反向传播算法是用
语义图像分割是将图像中的每个像素标记为相应的类的过程。基于编码器-解码器的方法,如U-Net及其变体,是解决医学图像分割任务的流行策略。为了提高U-Net在各种分割任务上的性能,我们提出了一种名为DoubleU-Net的新架构,它是两个U-Net架构相互堆叠的组合。第一个U-Net使用预训练的VGG-19作为编码器,它已经从ImageNet中学习了特征,可以轻松地转移到另一个任务中。为了有效地捕获







