logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

(CVPR-2025) MaskUNet:不是所有参数都关键:基于掩码的扩散模型生成能力增强方法

本文提出MaskUNet方法,通过分析扩散模型中U-Net参数的时间维度机制,发现适当置零部分参数(包括较大参数)能提升去噪效果。作者提出两种微调策略:1)训练式方法通过MLP生成时间步和样本相关的二值掩码;2)免训练方法直接利用奖励模型优化掩码。在COCO数据集上,MaskUNet在zero-shot推理中取得最优FID分数,并验证了在下游任务中的有效性。该方法不修改预训练参数,仅通过动态掩码选

文章图片
#计算机视觉#深度学习
(Arxiv-2025)DiC:重新思考扩散模型中的 Conv3x3 设计

扩散模型在视觉生成任务中表现出色。最近,这些模型已经从传统的 U 型 CNN-Attention 混合结构转变为完全基于 Transformer 的各向同性架构。虽然这些 Transformer 表现出强大的可扩展性和性能,但它们对复杂的自注意力操作的依赖导致推理速度缓慢。与这些工作相反,我们重新思考了深度学习中最简单但最快的模块之一 3x3 卷积,以构建一个放大的纯卷积扩散模型。我们首先发现,编

文章图片
#计算机视觉
(Arxiv-2024)E2EDiff:增强扩散模型的噪声到数据直接映射

扩散模型已成为生成建模的强大框架,在各种任务中都取得了最先进的性能。然而,它们面临着几个固有的局限性,包括训练采样差距、渐进噪声过程中的信息泄漏,以及无法在训练期间纳入感知和对抗损失等高级损失函数。为了应对这些挑战,我们提出了一个创新的端到端训练框架,通过直接优化最终的重建输出来协调训练和采样过程。我们的方法消除了训练采样差距,通过将训练过程视为从纯噪声到目标数据分布的直接映射来减轻信息泄漏,并将

文章图片
#计算机视觉#深度学习#人工智能
(CSUR-2024) 视频扩散模型综述

本文综述了视频扩散模型的最新研究进展,系统梳理了该领域在视频生成、编辑和理解任务中的应用。随着扩散模型在AIGC领域的崛起,其在视频处理中展现出超越传统GAN和Transformer方法的潜力。文章首先介绍了扩散模型的三种基础框架(DDPM、SGM、Score SDE),然后重点分析了视频生成(如文本到视频生成)、视频编辑和视频理解三大方向的研究现状,包括代表性方法、数据集和评估指标。作者指出,尽

文章图片
#音视频#计算机视觉#多模态 +1
(Arxiv-2024)LORA 与全微调:等效假象

微调是将预训练的大型语言模型适应下游任务的关键范例。最近,低秩自适应 (LoRA) 等方法已被证明可以在各种任务上与完全微调模型的性能相匹配,同时可训练参数的数量大大减少。即使在两种方法都学习到类似准确模型的环境中,它们学到的解决方案真的等价吗?我们通过分析模型的权重矩阵的谱特性,研究不同的微调方法如何改变预训练模型。我们发现,完全微调和 LoRA 产生的权重矩阵的奇异值分解表现出非常不同的结构;

文章图片
#python#机器学习#深度学习
(Arxiv 2025)一步扩散模型与 $f$-散度分布匹配

从扩散模型中采样涉及一个缓慢的迭代过程,这阻碍了其在实际应用中的部署,尤其是在交互式应用中。为了加速生成速度,近年来的方法通过变分评分蒸馏(variational score distillation)将多步扩散模型蒸馏到单步学生生成器中,从而使得学生生成的样本分布匹配教师模型的分布。然而,这些方法使用逆 Kullback-Leibler(KL)散度进行分布匹配,而这种方式已知具有模式塌陷的倾向。

文章图片
#计算机视觉#人工智能
(CVPR-2025)重建与生成之间的权衡:在潜空间扩散模型中驯服优化困境

本文针对潜空间扩散模型中存在的重建与生成优化困境,提出了一种视觉基础模型对齐的VAE(VA-VAE)方法。研究发现,传统高维分词器虽能提升重建质量,却导致扩散模型收敛困难。通过引入视觉基础模型对齐损失(VF Loss),该工作有效约束了潜空间分布,在保持高重建能力的同时显著提升生成性能。配合改进的LightningDiT框架,系统在ImageNet 256×256生成任务上取得FID 1.35的S

文章图片
(Arxiv-2024)自回归模型优于扩散:Llama用于可扩展的图像生成

摘要 香港大学提出的LlamaGen模型系列将大型语言模型的"下一个token预测"范式成功应用于图像生成,证明了纯粹自回归模型在没有视觉信号归纳偏置的情况下也能实现SOTA性能。该研究重新审视了图像标记器设计、模型可扩展性和训练数据质量等关键因素。主要贡献包括:(1)下采样比16的图像标记器,在ImageNet上取得0.94 rFID和97%码本使用率;(2)111M-3.1

文章图片
#数据挖掘#计算机视觉
(Arxiv-2026)超越文本提示:视觉到视觉生成作为统一范式

本文提出视觉到视觉(V2V)生成范式,通过视觉规格页面而非文本提示来指导生成模型。作者开发了V2V-Zero框架,利用冻结的视觉语言模型(VLM)将视觉页面映射到生成器已有的条件空间,无需额外训练。在GenEval基准测试中,V2V-Zero达到0.85分,接近骨干网络的文本到图像性能。作者还提出了Simple-V2V Bench基准,评估七种视觉条件任务,结果显示属性绑定能力较强,但结构控制仍具

文章图片
#音视频
(2020李宏毅)机器学习-Logistic Regression

文章目录Logistic RegressionThree Steps of machine learningStep1:Function SetStep 2: Goodness of a FunctionStep 3: Find the best functionLogistic Regression + Square errorGenerative v.s. DiscriminativeMult

文章图片
#机器学习#逻辑回归
    共 154 条
  • 1
  • 2
  • 3
  • 16
  • 请选择