logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

(Arxiv-2026)超越文本提示:视觉到视觉生成作为统一范式

本文提出视觉到视觉(V2V)生成范式,通过视觉规格页面而非文本提示来指导生成模型。作者开发了V2V-Zero框架,利用冻结的视觉语言模型(VLM)将视觉页面映射到生成器已有的条件空间,无需额外训练。在GenEval基准测试中,V2V-Zero达到0.85分,接近骨干网络的文本到图像性能。作者还提出了Simple-V2V Bench基准,评估七种视觉条件任务,结果显示属性绑定能力较强,但结构控制仍具

文章图片
#音视频
(2020李宏毅)机器学习-Logistic Regression

文章目录Logistic RegressionThree Steps of machine learningStep1:Function SetStep 2: Goodness of a FunctionStep 3: Find the best functionLogistic Regression + Square errorGenerative v.s. DiscriminativeMult

文章图片
#机器学习#逻辑回归
【李航】统计学习方法--15. 奇异值分解(详细推导)

文章目录15.1 奇异值分解的定义与性质15.1.1 定义与定理15.1.2 紧奇异值分解与截断奇异值分解15.1.3 几何解释15.1.4 主要性质15.2 奇异值分解的计算15.3 奇异值分解与矩阵近似15.3.1 弗罗贝尼乌斯范数15.3.2 矩阵的最优近似15.3.3 矩阵的外积展开式奇异值分解(singular value decomposition, SVD)是一种矩阵因子分解方法,是

文章图片
#线性代数#机器学习#算法
(CVPR-2025)无需归一化的Transformer

归一化层在现代神经网络中无处不在,并长期被认为是必不可少的。本研究表明,不使用归一化的Transformer可以通过一种极其简单的技术达到甚至超过标准性能。我们提出了Dynamic Tanh(DyT),这是一种逐元素的操作DyT⁡xtanh⁡αxDyTxtanhαx,可以直接替代Transformer中的归一化层。DyT的灵感来自于一个观察:Transformer中的层归一化通常会产生类似tanh

文章图片
#transformer#深度学习#人工智能
(Arxiv-2026)SAMA: 用于指令引导视频编辑的分解式语义锚定与运动对齐

本文提出SAMA框架,通过分解式语义锚定与运动对齐解决指令引导视频编辑中的语义-运动冲突问题。SAMA采用两阶段训练策略:首先通过语义锚定建立可靠的视觉锚点,并结合运动对齐预训练学习时序动态;随后在配对编辑数据上进行监督微调。该方法在开源模型中达到最先进性能,并与商业系统竞争力相当,验证了分解式学习范式的有效性。

文章图片
#音视频
(Arxiv-2026)SpatialEdit: 细粒度图像空间编辑基准测试

本文提出SpatialEdit框架,旨在解决图像细粒度空间编辑中的几何保真度问题。研究团队构建了SpatialEdit-500k合成数据集,通过Blender管线生成包含精确几何变换标注的50万张图像,涵盖物体平移/旋转/缩放和相机视角变化。基于此开发的SpatialEdit-16B模型在保持通用编辑能力的同时,显著提升了空间操控精度。新提出的SpatialEdit-Bench基准通过视点重建和构

文章图片
(Arxiv-2026)超越文本提示:视觉到视觉生成作为统一范式

本文提出视觉到视觉(V2V)生成范式,通过视觉规格页面而非文本提示来指导生成模型。作者开发了V2V-Zero框架,利用冻结的视觉语言模型(VLM)将视觉页面映射到生成器已有的条件空间,无需额外训练。在GenEval基准测试中,V2V-Zero达到0.85分,接近骨干网络的文本到图像性能。作者还提出了Simple-V2V Bench基准,评估七种视觉条件任务,结果显示属性绑定能力较强,但结构控制仍具

文章图片
#音视频
(Arxiv-2025)InstructX: 基于MLLM引导的统一视觉编辑

摘要 本文提出InstructX,一个基于多模态大语言模型(MLLM)引导的统一视觉编辑框架,能够同时处理图像和视频编辑任务。通过系统研究MLLM与扩散模型的整合方式,作者发现:(1)在图像数据上训练可以自然涌现视频编辑能力,缓解视频数据稀缺问题;(2)结合模态特定MLLM特征,可在单一模型中有效统一图像和视频编辑。实验表明,该方法在多种编辑任务上达到最先进性能,且无需显式视频监督即可实现零样本视

文章图片
#计算机视觉#人工智能
(ICML-2026)面向指令式视频编辑的区域约束上下文生成

本文提出ReCo,一种面向指令式视频编辑的区域约束上下文生成方法。针对视频编辑中编辑区域定位不准和token干扰问题,ReCo创新性地引入潜在空间正则化和注意力正则化:前者通过增大编辑区域潜在差异、减小非编辑区域差异来精准定位修改;后者抑制编辑区域对源视频的注意力,减少内容干扰。方法采用视频扩散Transformer架构,将源视频与目标视频拼接进行联合去噪训练。为支持模型训练,作者构建了包含50万

文章图片
#音视频#人工智能
(Arxiv-2026)FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配

本文提出FlowInOne框架,将多模态生成统一为纯视觉流的图像输入-输出范式。通过将文本、布局等输入转换为视觉提示,并使用单一流匹配模型处理,该方法消除了跨模态对齐瓶颈和任务特定架构。作者构建了VisPrompt-5M数据集(500万视觉提示对)和VP-Bench评估基准,涵盖文本生成、图像编辑和物理感知任务。实验表明,FlowInOne在指令忠实度、空间精度等方面达到SOTA性能,为全视觉中心

文章图片
    共 146 条
  • 1
  • 2
  • 3
  • 15
  • 请选择