
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
作者认为,Transformers可能缺乏卷积网络所拥有的某些理想的归纳偏差(inductive bias),这导致它们需要大量的数据和计算资源来补偿。因此本文主要讨论了如何将卷积神经网络(ConvNets)和自注意力机制(Transformers)结合在一起,以实现更好的图像分类性能。

本文将卷积神经网络CNN和PID (Proportional-Integral-Derivative)控制器联系起来,并表明一个两分支网络就相当于一个PI控制器,因此本质上存在类似的超调问题。为了解决这个问题,本文提出了一种新的三分支网络架构PIDNet,它包含三个分支分别用来解析细节信息、上下文信息和边缘信息,并采用边界注意力来指导detail branch和context branch的融合。
给定CNN某层的输出激活张量 \(A\in R^{C\times H\times W}\),输入到一个基于激活的映射函数 \(\mathcal{F}\) 得到得到一个spatial attention map这里隐含的假设是一个隐含神经元激活值的绝对值可以用来表明该神经元对某个特定输入的重要程度,比如注意力图上某个位置的值越大说明网络越关注该位置。基于该假设,我们可以沿通道维度上计算这些值的统计数
中,对两张图片mixup后只是合并了两张图中的所有gtbox,并没有对类别标签进行mixup。其中\(x_{i},x_{j}\)是从训练集中随机挑选的两张图像,\(y_{i},y_{j}\)是对应的one-hot标签,通过先验知识特征向量的线性插值和对应目标的线性插值还是对应的关系,构造了新的样本\((\widetilde{x},\widetilde{y})\)。其中\(\lambda\)通过\(
分类网络的最后一层通常会采用softmax将logits转化成各类别的最终预测概率,本文将带温度 \(T\) 的softmax输出作为大模型学习到的“知识”,并作为监督信号监督小模型的训练从而将大模型的知识传递给小模型。如下所示温度 \(T\) 的引入可以使大模型输出的概率分布较为缓和,\(T\) 越大,分布越缓和。比如以MINIST分类为例,对于某张“2”的图像大模型输出3的概率为\(10^{-
给定一个mini-batch的输入,教师网络 \(T\) 的某一层 \(l\) 的激活图activation map表示为 \(A^{(l)}_{T}\in \mathbf{R}^{b\times c\times h\times w}\),学生网络 \(S\) 对应层 \(l'\) 的输出表示为 \(A^{(l')}_{S}\in \mathbf{R}^{b'\times c'\times h'\
paper:U-Net: Convolutional Networks for Biomedical Image Segmentation以MMSegmentation中unet的实现为例,假设batch_size=4,输入shape为(4, 3, 480, 480)。
作者发现ViTs在ImageNet分类中的主要限制因素是其在将细粒度特征编码到token表示中的低效性。为了解决这个问题,本文引入了一种新的Outlook注意力机制,并提出了一种简单且通用的架构,称为Vision Outlooker(VOLO)。

anchor-based目标检测存在的缺陷:anchor会引入很多需要优化的超参数, 比如anchor number、anchor size、anchor ratio因为anchor的大小、比例、数量都是提前确定的,会影响模型的泛化性能。对与新的检测任务,需要重新设计anchor的各种参数。为了保证high recall rate,需要大量密集分布的anchor boxes,会导致训练阶段正负样本
本文解决了ViT在中等规模数据集上训练时性能不如CNN的问题。为此,作者提出了一种新的Tokens-to-Token Vision Transformer (T2T-ViT) 模型,通过改进图像切分和注意力机制设计来提升模型的训练效率和性能。








