logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

TrackFish3D 深度拆解:当一群鱼长得一模一样,怎么在 3D 里追踪每一条?

先说场景。行为生态学、水产养殖、群体机器人都在研究一件事:鱼群为什么能聚成群、怎么躲避捕食者、局部交互规则是什么。要回答这些问题,前提是拿到每一条鱼在三维空间中随时间变化的完整轨迹——不是 2D 投影,是 3D 的。而获取手段上,视觉是唯一可扩展、无侵入的方案。然后难题来了。鱼群的跟踪有三个叠加的"地狱级"设定:更糟的是,外观这条路也是死的。同一群鱼长得几乎一模一样,还频繁互相遮挡。传统多目标跟踪

文章图片
#3d#目标跟踪#图像处理
InfraVLA 深度解析:让机器人“偷看“监控摄像头导航,为什么光加编码器没用?

先说一个特别生活化的事实:你现在走进任何一个仓库、医院、写字楼、火车站,头顶上都挂着一堆摄像头。这些摄像头 7×24 小时看着整个建筑,实时、高清、还免费——毕竟早就装好了。而你派进去干活的机器人呢?它只看自己鼻子底下那一亩三分地。让它"走到那个箱子那儿去",箱子不在它视野里,它就只能一条过道一条过道地搜,搜到一半发现过道尽头被叉车堵死了,还得原路退回来。而头顶的摄像头把箱子在哪、哪条过道堵了看得

#机器人#视频编解码
ϕ-RIE 论文深度解析:从“拍照级重建“到“机器人可以动手“的最后一公里

这两年做视频编码和成像的人多多少少都摸过 3D Gaussian Splatting(3DGS):几百万个带位置、协方差、不透明度和球谐系数的各向异性高斯椭球,把一段多视角采集的画面拟合成一个可以实时渲染的辐射场。渲染层面它已经接近完美了—— ScanNet++ 上的源高斯重建 PSNR 可以做到 21.58 dB,肉眼看几乎就是照片。一个渲染得再真实的 3DGS 场景,机器人也拿不起里面的一只杯

#机器人#视频编解码#机器学习
IACE 深度解析:双臂机器人该怎么“分工“?AIST 用 14 组真机实验给出架构选型指南

双臂操作是机器人操作领域的硬骨头,也是这个系列博客的老朋友了——ALOHA、BRS、iDP3 里都绕不开它。双臂策略网络的架构本身该怎么设计?数据异构性:把两个 6-DoF 单臂(ViperX、UR5)或 7-DoF 臂(Franka)拼成 12/14-DoF 双臂,硬件构型一变,模型就得微调甚至重训——拼维度的做法对硬件差异零鲁棒性;单臂能力被稀释:双臂任务里左右手角色往往不同——“右手抓起物体

iDP3 深度解析:只用一个场景的数据,人形机器人凭什么能在整个世界干活?

人形机器人autonomous操作是机器人学几十年来的圣杯。2024 年硬件层面已经很热闹了——Boston Dynamics 的电动 Atlas、特斯拉 Optimus、Figure 01、宇树 H1,个个都像从科幻片里走出来的。能全身遥操作人形机器人,但学到的操作技能只认训练时那个场景,换个厨房就废;平台不支持移动底座和腰部自由度,工作空间小得可怜;倒是能泛化到新环境,但它靠的是20 个场景的

#机器人#深度学习#机器学习 +1
BRS 深度解析:斯坦福全家桶让轮式机器人承包家务,JoyCon 手柄立大功

这篇论文的起点很有意思:作者没有先造机器人,而是先做数据考古。双臂协调(Bimanual):搬大件、抱重物绕不开两只手;稳定精确的导航(Navigation):取个东西经常要跨越半个屋子;广域末端可达性(Reachability):作者统计了家庭任务相关物体的高度分布(Figure 2),发现物体高度呈多峰分布——0.09 m(地上)、0.49 m(低位台面)、0.94 m(桌面)、1.43 m(

#机器人
LeetCode 算法:二叉树展开为链表 c++

LeetCode 算法:二叉树展开为链表 c++

#算法#leetcode#链表 +2
leetcode 面试经典 150 题:合并区间

leetcode 面试经典 150 题:合并区间

文章图片
#leetcode#面试#算法 +1
LeetCode 算法:从前序与中序遍历序列构造二叉树 c++

LeetCode 算法:从前序与中序遍历序列构造二叉树 c++

#算法#leetcode#c++
H266/VVC多样化视频编码工具概述

H266多样化视频编码工具概述

文章图片
#视频编解码
    共 82 条
  • 1
  • 2
  • 3
  • 9
  • 请选择