
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Dolphins 是一个新型的视觉语言模型(VLM),它能够处理多模态输入(视频、图像、文本指令和历史控制信号),并结合情境指令微调和接地链式推理,提高对驾驶场景的理解和适应能力

T-GATE 发现推断过程可分为依赖交叉注意力来使用文本引导的语义生成阶段和增强保真度阶段。在后一阶段忽略文本,可在保持模型性能的同时降低计算复杂度。基于此,T-GATE 在交叉注意力输出收敛后将其缓存,并在剩余的推理步骤中保持不变。

本文提出无需预测布局的场景图生成图像。首先预训练场景图编码器,然后使用基于对象嵌入和关系嵌入创建 CLIP 引导的调节信号来微调预训练的扩散模型。

本文基于对象的外观和其类别初始化一个原型嵌入,然后对扩散模型进行微调。微调时使用类别特征正则化保留对对象类别的先验知识,并引入对象特定的损失来进一步提高保真度。这也可以用于植入多个对象。

在这项研究中,我们研究了去噪扩散模型(Denoising Diffusion Models,DDM)的表示学习(representation learning)能力,这些模型最初是为图像生成而设计的。我们的理念是解构一个DDM,逐渐将其转化为经典的去噪自动编码器(Denoising Autoencoder,DAE)。这个解构过程使我们能够探索现代 DDM 的各个组件如何影响自监督表示学习(self

本文探索了量子去噪扩散模型,引入了 Q-Dense 和 QU-Net。此外,引入幺正单采样量子一致性模型,它将扩散过程整合成一个幺正矩阵,实现了一步图像生成。

受文本到 3D 合成的 NeRF 的启发,本文提出无图像蒸馏方案 SwiftBrush,利用相同的损失,将经过预训练的多步文本到图像模型蒸馏到只需单一推理步骤就能生成高保真图像的学生网络。

本文提出一种神经网络架构ControlNet,可将条件控制添加到大型预训练文本到图像扩散模型中,并使用无分类器引导分辨率加权来提高生成质量。

本文使用输入主体的一些图像对预训练的文本到图像模型进行微调,使其学会将唯一标识符与特定主体关联起来,唯一标识符可以用于在不同场景中合成主体的新逼真图像。使用先验保存损失,来鼓励多样性并抵消语言漂移

本文提出 sViT,它利用分割模型 SAM,有效地利用语义信息, 创建了类似于 CNN 的归纳偏差,同时捕获了图像中的全局依赖性和上下文信息。








