
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要:本文提出Diffuman4D方法,通过滑动迭代去噪机制增强4D扩散模型的时空一致性,实现稀疏视角视频的高质量视图合成。该方法定义4D潜在网格编码图像、位姿和姿态信息,采用滑动窗口在时空维度交替去噪,使信息充分流动。实验证明,在DNA-Rendering和ActorsHQ数据集上,该方法生成的视频在PSNR、SSIM等指标上显著优于现有技术,保持更好的时空连贯性,同时控制GPU内存消耗。研究还

为了支持FilmAgent框架的电影制作流程,作者团队精心构建了虚拟3D空间。这些空间包括15个反映日常设置的场景,如客厅、厨房、办公室和路边等,为各种叙事提供了多样化的背景。每个场景都预先配置了演员位置和摄像机设置,以满足不同拍摄需求。演员位置:环境中包括32个站立点和33个坐立点,每个点都附有详细描述,指示其位置。摄像机设置:定义了9种镜头类型,包括3种静态镜头(特写、中景和远景)和6种动态镜

摘要:本研究推出GLM-4.1V-Thinking视觉语言模型,通过大规模预训练和创新的课程采样强化学习(RLCS)框架,显著提升了多模态推理能力。模型在28个基准测试中全面超越同类7B模型,与72B大模型相比,在18项任务中表现相当或更优,尤其在STEM推理和长文档理解等复杂任务上展现出竞争力。研究开源了GLM-4.1V-9B-Thinking模型,其性能媲美GPT-4o等闭源模型,为多模态AI

摘要:本研究挑战了强化学习(RL)仅放大语言模型已有能力的观点,提出通过Prolonged RL(ProRL)训练可发现全新推理策略。ProRL方法整合KL散度控制、策略重置和多样化任务,在16,000 GPU小时的训练后,模型在数学、代码等任务上pass@1准确率提升14.7%-54.8%,特别解决了基础模型完全失败的场景。研究表明RL能持续扩展推理边界,其效果取决于基础模型能力和训练时长。虽然

空间参照是体现机器人与3D物理世界交互的基本能力。 然而,即使使用强大的预训练视觉语言模型(VLM),最近的方法仍然无法准确理解复杂的3D场景,也无法动态推理指令指示的交互位置。 为此,我们提出了RoboRefer,这是一种3D感知的VLM,可以通过监督式微调(SFT)集成一个解耦但专用的深度编码器,首先实现精确的空间理解。 此外,RoboRefer通过强化微调(RFT)推进了广义多步空间推理,并

监督式微调(SFT)和强化学习(RL)是基础模型后训练中广泛使用的技术。然而,它们在增强模型泛化能力方面的作用尚不清楚。本文研究了SFT和RL在泛化与记忆方面的差异,重点关注基于文本的规则变体和视觉变体。我们引入了GeneralPoints,一种算术推理纸牌游戏,并采用V-IRL,一个真实世界的导航环境,来评估通过SFT和RL训练的模型如何在文本和视觉领域泛化到未见过的变体。我们发现,尤其是在基于

摘要:本研究提出VLA-RFT强化微调框架,通过数据驱动世界模型构建可控模拟器,解决VLA模型依赖模仿学习导致的鲁棒性不足问题。该框架利用世界模型预测未来观测并生成密集奖励信号,仅需400步微调即超越监督基线,效率优于传统强化学习方法。实验表明,VLA-RFT在LIBERO基准测试中成功率提升至91.3%,且在扰动条件下保持稳定性能。研究验证了基于世界模型的强化微调对提升VLA模型泛化能力的有效性

本文介绍了VisualQuality-R1,一种基于强化学习的无参考图像质量评估(NR-IQA)模型,旨在通过推理诱导机制提升模型的泛化能力和性能。该模型采用组相对策略优化和瑟斯顿模型,通过比较图像对之间的质量来生成质量分数,并使用连续保真度度量作为奖励函数。实验结果表明,VisualQuality-R1在多个数据集上均优于传统的基于深度学习的NR-IQA模型和基于视觉语言模型的监督微调方法。此外

Difix3D+是一种通过单步扩散模型来增强3D重建和新视角合成的新型管道。其核心是Difix模型,一个专门用于去除NeRF和3DGS渲染伪影的单步图像扩散模型。

【摘要】本研究针对3D室内场景生成任务,提出创新解决方案:1)构建包含12,328个结构化场景、57,440个房间及470万张渲染图的大规模数据集;2)开发SpatialGen多视图多模态扩散模型,通过布局引导的注意力机制实现跨视角、跨模态的语义一致性生成。实验证明,该模型在CLIP相似度等指标上优于现有方法,能基于3D布局和文本提示生成高质量的场景坐标图、语义分割图等多模态输出。研究将开源数据和








