
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
LingBot-VLA 是由蚂蚁集团提出的实用型视觉-语言-动作(VLA)基础模型,基于约20,000小时来自9种双臂机器人的真实世界数据训练而成。通过在4种机器人平台上对100项任务进行大规模评估,该模型展现出卓越的泛化能力与任务成功率,且性能随数据量增加持续提升,未见饱和。研究还构建了高效代码库,在8卡配置下实现每秒261样本吞吐量,较现有框架提速1.5–2.8倍。论文开源代码、模型与基准数据

Motus(CVPR 2026)提出一种统一的潜在动作世界模型,通过混合Transformer(MoT)架构融合视觉-语言理解、视频生成与动作专家,实现五类具身建模范式的统一:VLA、WM、IDM、VGM与联合预测。引入基于光流的潜在动作表示,结合六层数据金字塔与三阶段训练流程,实现跨具身体的动作先验迁移。实验表明,该模型在仿真与真实场景中显著优于X-VLA和π⁰.⁵,性能提升达+15%至+48%

π₀.₅ 是一种具备开放世界泛化能力的视觉-语言-动作模型,通过协同训练多种异质数据源(如多机器人数据、网络文本、高层语义预测与口头指令),实现跨环境、跨任务的强泛化。该模型采用分层架构,先预测高层子任务,再生成低层动作,可在未见过的家庭环境中自主完成清洁厨房、整理卧室等持续10–15分钟的复杂操作。实验证明,其泛化能力源于多样化知识迁移,是首个实现端到端学习驱动的长时程灵巧操作的系统。

本文介绍了C-R不等式(Rao-Cramer不等式)在参数估计中的应用。首先定义了Rao-Cramer正则分布族的五个条件,并通过Poisson分布和正态分布的例子验证其满足这些条件。然后给出了Rao-Cramer不等式的主要结论:对于Rao-Cramer正则分布族,任何无偏估计量的方差存在一个下界(C-R下界)。文章还讨论了该不等式的适用条件和特殊情况,指出均匀分布族不属于正则分布族,因此不等式

本文介绍3DGS & 世界模型领域CVPR 2026新工作GaussianDWM。论文提出了一种新型统一驾驶世界模型框架,在同一架构中同时支持场景理解和场景生成。论文通过将三维高斯场景表示与任务感知的混合高斯采样策略相结合,有效弥合了场景理解与场景生成之间的差距,并实现了世界查询信息向大语言模型中的有效注入。大量实验验证了论文方法的有效性,结果表明该方法能够显著提升场景理解能力和场景生成能力。论文

GaussianDream提出前馈式3D高斯世界模型插件,用于机器人操作,解决VLA缺乏3D空间、密集监督和未来预测的问题,训练时重建和预测,推理时只保留前缀,性能SOTA。

【CMU 11-868】课程面向研究生开设,聚焦“从算法到工程”的大语言模型系统构建全过程。GPU 编程与自动微分:掌握 CUDA kernel 调用、并行编程基础,以及深度学习框架设计原理模型训练与分布式系统:学习高效的训练算法、通信优化(ZeRO、FlashAttention)、分布式训练框架(DDP、GPipe、Megatron-LM)。模型压缩与加速:量化(GPTQ)、稀疏化(MoE)、编

本文介绍了ICCV 2025的工作《GWM: Towards Scalable Gaussian World Models for Robotic Manipulation》,提出了一种基于3D高斯表示的新型世界模型Gaussian World Model (GWM)。该模型通过结合3D高斯溅射与扩散Transformer,实现了机器人操作任务中未来场景的准确预测。GWM包含两个核心组件:3D高斯

本文介绍CVPR 2026智能体长视频理解新工作Symphony。Symphony通过模拟人类认知模式,将任务分解为多个专门化智能体协作完成,包括规划、定位、视觉感知、字幕和反思智能体。Symphony采用反思增强的动态推理框架,通过迭代优化推理过程提升准确性。实验在LVBench等四个数据集上验证了其有效性,性能较现有方法提升5.0%。该方法为长视频理解提供了一种新的认知启发式解决方案。

本文介绍Meta新作EGAgent。EGAgent是一种基于实体场景图的智能体框架,用于解决超长视频理解任务。该方法通过构建人物、物体和地点之间的时空关系图,结合视觉和音频搜索工具,实现对连续数天视频的多模态推理。实验表明,EGAgent在EgoLifeQA和Video-MME(Long)数据集上分别达到57.5%和74.1%的准确率,显著优于现有方法。该研究为可穿戴设备AI助手的长时记忆和推理能








