logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

原文链接:https://arxiv.org/pdf/2608.15265项目链接:https://usail-hkust.github.io/VibeWorlding-Gym/基于论文原文的引言部分,端到端交互式3D开放世界构建在游戏、仿真、具身AI领域具备重要应用价值,随着多模态大语言模型(MLLM)的发展,基于MLLM的3D世界构建智能体已成为学术与工业界的关注热点,但现有研究存在三大核心痛

文章图片
#3d
Breaking the Synthetic Barrier: Towards Stable and Generalizable Real-World Image Dehazing

本文提出了一种突破合成数据限制的图像去雾新方法。针对现有算法在真实场景中因领域差距导致的性能下降问题,创新性地设计了多级子空间分布适配器(MSDA)和双域同步优化(DDSO)策略。MSDA通过层级化子空间建模,在感知、结构和语义三个层面实现跨域特征对齐;DDSO则联合利用合成数据的监督信息和真实数据的分布特性进行同步优化。实验表明,该方法在多个数据集上显著提升性能,在RTTS数据集上的FADE指标

文章图片
#计算机视觉#深度学习
【3D场景生成】UnrealLLM: Towards Highly Controllable and Interactable 3D Scene Generation

本文提出UnrealLLM框架,通过大语言模型驱动程序化内容生成实现高可控、可交互的3D场景自动创建。该框架构建了多智能体系统,将自然语言描述转换为虚幻引擎5可执行的程序化生成蓝图,包含场景分析、资源检索、节点配置等模块。创新性地提出基于文本的蓝图表示方法,并建立多模态资源库支持上下文感知检索。实验表明,UnrealLLM在生成质量、规模控制和交互性方面具有优势,为自动化3D内容创作提供了新思路。

文章图片
#3d#虚幻#游戏引擎
【3D 场景生成】SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

本文提出SAGE框架,通过智能体驱动的3D场景生成方法解决具身AI训练数据获取难题。SAGE将用户任务指令转化为仿真就绪的3D场景,结合生成器工具集与视觉/物理双批评器实现迭代优化,确保场景的语义合理性与物理稳定性。实验表明,基于SAGE生成数据训练的具身策略性能显著提升,并能泛化至新物体与布局。该工作为仿真驱动的具身AI规模化训练提供了有效解决方案。

文章图片
#3d#人工智能
【3D 物理场景生成】SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

SceneSmith提出了一种智能体框架,用于根据自然语言提示自动生成仿真就绪的室内场景。该方法通过分层式智能体交互(设计者、评判者、协调者)构建场景,从建筑布局到家具摆放再到物体填充,并整合文本到3D合成与物理属性估计。实验表明,SceneSmith生成的场景物体密度是基线的3-6倍,碰撞率低于2%,96%的物体物理稳定。用户研究显示,其真实感和提示词保真度胜率分别达92%和91%。该框架可直接

文章图片
#3d
【3D 物理场景生成】SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

SceneSmith提出了一种智能体框架,用于根据自然语言提示自动生成仿真就绪的室内场景。该方法通过分层式智能体交互(设计者、评判者、协调者)构建场景,从建筑布局到家具摆放再到物体填充,并整合文本到3D合成与物理属性估计。实验表明,SceneSmith生成的场景物体密度是基线的3-6倍,碰撞率低于2%,96%的物体物理稳定。用户研究显示,其真实感和提示词保真度胜率分别达92%和91%。该框架可直接

文章图片
#3d
【3D 场景生成】SceneCode: Executable World Programs for Editable Indoor Scenes with Articulated Objects

SceneCode是一种将自然语言提示编译为可执行代码的室内场景生成框架,可生成具备物理交互能力的铰接物体。其核心创新在于将场景表示为程序而非静态网格,支持按需生成全新可交互资产。框架通过房间级智能体规划布局,再调用视觉语言模型生成Blender Python代码逐部件构建物体,最终输出仿真就绪的SDF资产。实验表明,SceneCode在场景保真度、物体质量及机器人交互适用性上优于现有方法,实现了

文章图片
#3d
【3D 场景生成】SCENEWEAVER: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

摘要: SCENEWEAVER是一种具备自反思能力的智能体框架,专为3D室内场景合成设计,结合多元生成工具与闭环优化策略,解决现有方法在物理合理性、视觉真实感和语义匹配度上的不足。其核心是通过大语言模型驱动的规划器(Reason-Act-Reflect循环)动态调用标准化工具(如数据驱动模型、LLM、2D引导工具),迭代优化场景布局与细节。物理感知执行器确保零碰撞与零越界,多源资产库支持开放词汇需

文章图片
#3d
【3D 场景生成】SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

本文提出SAGE框架,通过智能体驱动的3D场景生成方法解决具身AI训练数据获取难题。SAGE将用户任务指令转化为仿真就绪的3D场景,结合生成器工具集与视觉/物理双批评器实现迭代优化,确保场景的语义合理性与物理稳定性。实验表明,基于SAGE生成数据训练的具身策略性能显著提升,并能泛化至新物体与布局。该工作为仿真驱动的具身AI规模化训练提供了有效解决方案。

文章图片
#3d#人工智能
【3D 物理布局生成】PHYSCENE: Physically Interactable 3D Scene Synthesis for Embodied AI

本文提出PHYSCENE,一种面向具身AI的高物理交互性3D场景生成方法。该方法基于条件扩散模型,通过创新的物理引导机制(碰撞避免、房间布局约束、智能体可达性)优化场景布局,并引入跨库形状检索嵌入可交互关节物体。实验表明,PHYSCENE生成的场景在物理合理性和交互可用性上显著优于现有方法,能有效支持具身智能体的技能学习。核心创新在于将抽象物理约束转化为可微分引导函数,实现了数据驱动与物理规则的有

文章图片
#3d#人工智能
    共 73 条
  • 1
  • 2
  • 3
  • 8
  • 请选择