logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

论文笔记(一百零二)Cambrian-S: Towards Spatial Supersensing in Video(一)

我们认为,要在真正的多模态智能上取得进展,就必须从那种被动响应、任务驱动的系统以及单纯依赖“暴力拉长上下文长度”的做法,转向一种更为宏观的“超级感知”(supersensing)范式。我们将空间超级感知划分为超越“仅凭语言理解”的四个阶段:语义感知(给看到的内容命名)、流式事件认知(在连续体验中保持记忆)、隐式三维空间认知(从像素背后推断现实世界),以及预测式世界建模(构建用于过滤和组织信息的内部

文章图片
#论文阅读
论文笔记(一百零二)Cambrian-S: Towards Spatial Supersensing in Video(二)

摘要:本文介绍了Cambrian-S在视频空间超感知领域的研究进展,重点围绕VSI-SUPER基准和VSI-590K数据集展开。VSI-SUPER包含Recall和Count两个子任务,分别通过插入不寻常物体和拼接室内视频测试模型的长时记忆与动态计数能力。VSI-590K数据集则系统定义了4类空间-时间问题,并详细描述了3D标注视频、模拟数据及网络视频的标注流程。实验表明,配置、测量和时空三类任务

文章图片
#论文阅读
论文笔记(一百一十二)Pos3R: 6D Pose Estimation for Unseen Objects Made Easy

Pos3R: 基于3D基础模型的零样本6D位姿估计方法 本文提出Pos3R,一种无需训练的6D物体位姿估计方法,通过利用3D重建基础模型(如MASt3R)解决传统2D方法在平面外旋转下的性能瓶颈。该方法采用两阶段流程:1)使用3D模型生成多视角模板并提取三维一致性特征;2)通过特征匹配和PnP计算最终位姿。实验表明,Pos3R在BOP基准测试中达到与现有方法相当的性能,尤其在处理未见物体时展现优势

文章图片
#论文阅读
论文笔记(一百一十七)WorldVLA Towards Autoregressive Action World Model Model

WorldVLA:一种自回归动作世界模型 本文提出WorldVLA模型,通过整合视觉-语言-动作(VLA)模型与世界模型,实现了动作与图像理解的统一框架。该模型采用三个独立分词器处理多模态输入,共享统一词表以支持跨模态生成。世界模型通过学习环境物理规律预测未来图像,提升动作生成能力;动作模型则基于图像观测生成动作序列,促进视觉理解。研究发现自回归动作生成存在误差累积问题,为此提出注意力掩码策略,在

文章图片
#论文阅读
论文笔记(一百一十八)One2Any: One-Reference 6D Pose Estimation for Any Object

本文提出了一种名为One2Any的新型6D物体位姿估计方法,仅需单张参考RGB-D图像即可实现任意物体的位姿估计,无需3D模型或多视角数据。该方法通过编码-解码框架,将参考图像编码为综合位姿嵌入(ROPE),再解码生成参考物体坐标(ROC)进行位姿估计。实验表明,One2Any在多个基准数据集上实现了与依赖CAD模型或多视角方法相当的性能,同时计算效率更高。该方法突破了传统位姿估计对完整3D模型的

文章图片
#论文阅读
PyBullet(六)UR5机器人手臂模型

UR5机器人手臂模型1. urdf文件2. 效果展示(暂时还没有录像)3. 总结申明:停更了一段时间hhhhh,真是不好意思。由于英国疫情比较严重,自20年12月中旬回国之后,在深圳找了6个月的实习,想等到英国疫情好了之后再回去继续完成博士学业。最近公司的项目在搞UR5机器人手臂的控制,打算分步简单的记录一下,方便以后回顾。本篇文章只是简单的记录下UR5机器人的模型结构(urdf文件)。 这次项目

#python
论文笔记(一百三十五)Learning Object-Centric Spatial Reasoning... in Cluttered Environments(二)

摘要: 本文提出了一种名为 Unveiler 的模块化框架,用于解决密集杂乱环境中的机器人顺序操作任务,重点针对目标物体被遮挡的场景。该方法将高层 空间关系推理 与低层 动作执行 解耦,通过轻量级 Transformer 编码器(SRE)识别最优障碍物移除顺序,再由旋转不变动作解码器执行具体操作。实验表明,该框架在仿真环境中部分遮挡场景下成功率高达 97.6%,且参数量(83M)和推理延迟显著低于

文章图片
#论文阅读
    共 155 条
  • 1
  • 2
  • 3
  • 16
  • 请选择