logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【ViT】【ICLR 2021】用Transformer做大规模图像识别

作者提出了Vision Transformer(ViT)模型,表明计算机视觉任务对于卷积神经网络的依赖是不必要的,可以利用一个基本的Transformer直接作用于一系列图像块,在图片分类任务中可以取得良好的效果。在大规模数据集上训练后,迁移到中小型数据集进行使用,Vision Transformer可以获得与最好的卷积神经网络相媲美的结果,同时需要的训练资源更少。

#transformer#计算机视觉#深度学习
到底了