logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

(2024|ECCV|NVIDIA)Dolphins: 多模态语言模型在自动驾驶中的应用

Dolphins 是一个新型的视觉语言模型(VLM),它能够处理多模态输入(视频、图像、文本指令和历史控制信号),并结合情境指令微调和接地链式推理,提高对驾驶场景的理解和适应能力

文章图片
#人工智能#自动驾驶#语言模型 +1
(2024,时控交叉注意力(T-GATE),缓存和复用交叉注意力图)交叉注意力使文本到图像扩散模型的推理变得麻烦

T-GATE 发现​推断过程可分为依赖交叉注意力来使用文本引导的语义生成阶段和增强保真度阶段。在后一阶段忽略文本,可在保持模型性能的同时降低计算复杂度。基于此,T-GATE 在交叉注意力输出收敛后将其缓存,并在剩余的推理步骤中保持不变。

文章图片
#人工智能
(2024,预训练和微调扩散,图编码器,图特征与CLIP特征对齐)场景图到图像合成:集成 CLIP 指导与扩散模型中的场景图条件

本文提出无需预测布局的场景图生成图像。首先预训练场景图编码器,然后使用基于对象嵌入和关系嵌入创建 CLIP 引导的调节信号来微调预训练的扩散模型。

文章图片
#深度学习#人工智能#计算机视觉
(2024,初始化原型嵌入,扩散模型微调,类别特征正则化,对象特定损失)使用原型嵌入对文本到图像扩散进行对象驱动的单样本微调

本文基于对象的外观和其类别初始化一个原型嵌入,然后对扩散模型进行微调。微调时使用类别特征正则化保留对对象类别的先验知识,并引入对象特定的损失来进一步提高保真度。这也可以用于植入多个对象。

文章图片
#计算机视觉#人工智能
(2024,L-DAE,去噪 DM,去噪 AE,影响 SSRL 性能的关键成分,PCA 潜在空间)解构自监督学习的去噪扩散模型

在这项研究中,我们研究了去噪扩散模型(Denoising Diffusion Models,DDM)的表示学习(representation learning)能力,这些模型最初是为图像生成而设计的。我们的理念是解构一个DDM,逐渐将其转化为经典的去噪自动编码器(Denoising Autoencoder,DAE)。这个解构过程使我们能够探索现代 DDM 的各个组件如何影响自监督表示学习(self

文章图片
#人工智能
(2024,密集量子电路,量子 U-Net,幺正单采样)量子去噪扩散模型

本文探索了量子去噪扩散模型,引入了 Q-Dense 和 QU-Net。此外,引入幺正单采样量子一致性模型,它将扩散过程整合成一个幺正矩阵,实现了一步图像生成。

文章图片
#量子计算#计算机视觉
(2023,3D NeRF,无图像变分分数蒸馏,单步扩散)SwiftBrush:具有变分分数蒸馏的一步文本到图像扩散模型

受文本到 3D 合成的 NeRF 的启发,本文提出无图像蒸馏方案 SwiftBrush,利用相同的损失,将经过预训练的多步文本到图像模型蒸馏到只需单一推理步骤就能生成高保真图像的学生网络。

文章图片
#人工智能#计算机视觉
(2023,ControlNet,CFGRW,diffusion,控制组合)向文本到图像扩散模型添加条件控制

本文提出一种神经网络架构ControlNet,可将条件控制添加到大型预训练文本到图像扩散模型中,并使用无分类器引导分辨率加权来提高生成质量。

文章图片
#人工智能#深度学习
(2023|CVPR,扩散,主体标识符,先验保存损失)DreamBooth:微调文本到图像的扩散模型以实现主题驱动的生成

本文使用输入主体的一些图像对预训练的文本到图像模型进行微调,使其学会将唯一标识符与特定主体关联起来,唯一标识符可以用于在不同场景中合成主体的新逼真图像。使用先验保存损失,来鼓励多样性并抵消语言漂移

文章图片
#人工智能#计算机视觉
(2024,sViT,语义分割,SAM,可解释性)具有自然语言语义的 ViT

本文提出 sViT,它利用分割模型 SAM,有效地利用语义信息, 创建了类似于 CNN 的归纳偏差,同时捕获了图像中的全局依赖性和上下文信息。

文章图片
#人工智能#计算机视觉
    共 180 条
  • 1
  • 2
  • 3
  • 18
  • 请选择