
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
UniJEPA 以离散理解、连续未来视觉特征预测与 Flow Matching 动作生成的三流结构,提升机器人在新物体和复杂操作中的泛化能力。

Faster-WAM 在推理期保留未来表征,却用一次 K/V 缓存、稀疏跨分支交互和区间融合降低联合世界动作模型的成本。本文拆解其方法、OOD 证据、真实机器人结果与延迟边界。

解读 Kimi K3 已公开的架构与推理基础设施信息,梳理 Kimi Delta Attention、Stable LatentMoE、长上下文与开放权重计划,并区分官方披露与技术推断。

WorldDiT 以统一扩散 Transformer 联合训练动作生成与未来 RGB patch 预测,在部署时只保留动作分支。本文拆解其 399M 参数架构、flow matching、LIBERO 结果及证据边界。

CoTinyVLA 用双视角时序输入、Plan–Think 分层推理蒸馏与指令释义扩增,让 0.9B VLA 在 LIBERO-Plus 的四个鲁棒性套件上超过最强 7B 基线。本文拆解方法、实验证据与部署边界。

这篇名为 JavisVerse 的综述深入探讨了大型基础模型时代的视听智能(AVI)发展现状。作者群来自新加坡国立大学、牛津大学及微软等顶级机构,系统性地构建了涵盖感知、生成与交互三大维度的技术分类体系。文中详尽梳理了从模态表征、跨模态对齐到自回归与扩散生成的核心技术演进路径。

通用导航基础模型NavFoM,通过统一输入语法与轨迹输出接口,整合了不同任务和机器人本体的导航需求。NavFoM采用7B参数模型,处理多视角视觉输入,输出8个未来轨迹点,覆盖VLN、目标搜索、视觉跟踪和自动驾驶等多个任务。关键技术包括TVI token标记时空信息,BATS算法优化历史帧采样,联合训练802万导航样本和476万QA数据。实验显示NavFoM在7个基准上表现良好,但性能仍低于专用模型

本文提出 DualVLN 方法,通过将视觉语言导航(VLN)任务拆分为异步的双系统架构,解决大模型推理延迟与机器人实时控制需求之间的矛盾。System 2(Qwen2.5-VL-7B)以约 2Hz 频率进行语义推理,输出图像中的像素目标及其隐式表示;System 1(轻量 DiT)以 30Hz 读取新画面,将旧目标持续转化为 32 个平滑轨迹点供底层控制器(200Hz)跟踪。实验显示,该方法在 R

DeMaVLA提出一种面向可泛化柔性物体操作的视觉-语言-动作(VLA)基础模型,通过预训练学习双臂操作先验,结合动作分支裁剪和实时训练优化,实现多类衣物折叠任务。模型以Qwen3-VL为视觉语言骨干,外挂轻量级Action Expert处理连续动作,并采用人机协同DAgger机制收集失败修正数据。实验表明,该模型在仿真和真实环境中均表现优异,验证了大规模真实数据、分层动作设计与纠错机制对柔性操作

DeMaVLA提出一种面向可泛化柔性物体操作的视觉-语言-动作(VLA)基础模型,通过预训练学习双臂操作先验,结合动作分支裁剪和实时训练优化,实现多类衣物折叠任务。模型以Qwen3-VL为视觉语言骨干,外挂轻量级Action Expert处理连续动作,并采用人机协同DAgger机制收集失败修正数据。实验表明,该模型在仿真和真实环境中均表现优异,验证了大规模真实数据、分层动作设计与纠错机制对柔性操作








