logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

<<视觉问答>>2022:SwapMix: Diagnosing and Regularizingthe Over-Reliance on Visual Context in VQA

先看一下下面这篇论文对VQA任务语言偏差的介绍Greedy Gradient Ensemble for Robust Visual Question Answering摘要虽然VQA发展迅速,但之前的工作对当前VQA模型的健壮性提出了担忧。在这项工作中,我们从一个新的角度研究了VQA模型的稳健性:视觉上下文。我们认为,这些模型过度依赖视觉的上下文部分,即图像中与正确的、应该注意到的对象所不相关的对

#计算机视觉#人工智能#深度学习 +2
<<多模态预训练—泛读系列(一)>>ViLBERT—(NeurIPS-2019),VL-BERT—(ICLR-2020),VisualBERT—(ACL-2020)

介绍:ViLBERT,一种用于学习图像和自然语言的任务不可知的联合表征的模型,将BERT架构扩展到多模态双流架构,两个独立的分支分别处理视觉和文本输入,co-attention层用以交互图像和文本。在自动收集的大型captions数据集上通过两个预训练任务对模型进行预训练,然后将其迁移到多个视觉和语言下游任务中,视觉问答、视觉常识推理、引用表达式和基于caption的图像检索。......

#深度学习#自然语言处理#人工智能 +1
<<计算机视觉NeurIPS>>2022:GLIPv2: Unifying Localization and VL Understanding

建立一个通用的,可以同时处理任务(image classification、object detection和segmentation等等)和任务(VQA和image captioning等等)的在过去一两年广为关注,这需要模型能够有效的统一和任务。然而,这两种任务有很大的区别:localization是仅视觉的任务,需要细粒度的输出(例如,bounding boxes或pixel masks),

#计算机视觉#自然语言处理#深度学习 +1
<<视觉问答>>2021:Zero-shot Visual Question Answering usingKnowledge Graph

目录摘要:一、介绍二、相关工作2.1、Visual Question Answering2.2、Zero-shot VQA三、Preliminaries四、Methodology4.1 Main Idea4.2 Establishment of Multiple Feature Spaces4.3 Answer Mask via Knowledge五、实验5.1 Datasets and Metr

#人工智能#计算机视觉#深度学习 +1
<<多模态预训练and视觉问答>>2019:LXMERT: Learning Cross-Modality Encoder Representations from Transformers

摘要:视觉语言推理需要理解视觉概念、语言语义,以及最重要的,这两种模式之间的对齐和关系。因此,我们提出LXMERT(利用Transformers学习跨模态编码器表示)框架来学习这些视觉和语言的关系,在LXMERT中,我们构建了一个大规模的Transformer模型,该模型由三个编码器组成:对象关系编码器、语言编码器和跨模态编码器,接下来,为了赋予我们的模型连接视觉和语言语义的能力,我们使用大量的图

#计算机视觉#深度学习#人工智能
<<视觉问答>>2021:Linguistically Routing Capsule Network forOut-of-distribution Visual Question Answerin

摘要:对分布不同的测试数据的泛化是视觉问答中一个重要但尚未充分探讨的主题,当前最先进的VQA模型经常利用数据和标签之间的有偏差的相关性,当测试和训练数据具有不同的分布时,这会导致很大的性能下降。人类可以通过组合已有的概念来识别新的概念,胶囊网络具有表示部分-整体层次结构的能力,受此启发,作者提出使用胶囊来表示部分,并引入“语言路由”来建模部分到整体的层次结构。具体来说,作者首先将视觉特征与单个问题

#计算机视觉#人工智能#深度学习
<<多模态预训练—泛读>>2022:Bridging Video-text Retrieval with Multiple Choice Questions

目录问题与方案一、Introduction二、Related Work三、Method3.1、Dual-encoder for Video-text Pre-training: a revisit3.2、Multiple Choice Questions 3.3、Pre-training Objectives3.4、Model Architecture3.4.1、VideoFormer3.4.2、

#人工智能#transformer#自然语言处理 +1
<<多模态预训练>>2022:CoCa: Contrastive Captioners are Image-Text Foundation Models

目录Abstract1、Introduction2、Related Work3、Approach3.1、Natural Language Supervision3.2、Contrastive Captioners Pretraining3.3、Contrastive Captioners for Downstream Tasks4、Experiments5、Conclusion对于视觉和视觉语言问

#计算机视觉#人工智能#深度学习 +1
到底了