
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
【ViT】【ICLR 2021】用Transformer做大规模图像识别
作者提出了Vision Transformer(ViT)模型,表明计算机视觉任务对于卷积神经网络的依赖是不必要的,可以利用一个基本的Transformer直接作用于一系列图像块,在图片分类任务中可以取得良好的效果。在大规模数据集上训练后,迁移到中小型数据集进行使用,Vision Transformer可以获得与最好的卷积神经网络相媲美的结果,同时需要的训练资源更少。
到底了







