logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【CVPR 2026】Motus:一个模型贯通理解、预测与控制|从统一世界模型架构视角

【CVPR 2026】Motus 统一潜在动作世界模型论文解读:三专家 Mixture-of-Transformers 一个网络统一 VLA、WM、IDM、VGM 与联合视频动作预测五种模式,光流潜在动作将 90% 无标签具身视频转为运动监督;RoboTwin 平均成功率 88.66/87.02,真实平台 AC-One 63.22、Aloha-2 59.30。

文章图片
【arXiv 2026】世界行动模型即零样本策略|从视频扩散世界模型视角

【arXiv 2026】DreamZero 论文解读:14B 世界行动模型(WAM)零样本泛化 2 倍超越最先进 VLA(AgiBot unseen 39.5% vs 16.3%),10-20 分钟视频跨本体迁移 +42% 相对提升,38× 推理加速实现 7Hz 实时闭环控制。

文章图片
#视频生成
【arXiv 2025】[PC] Vidar — 视频扩散先验驱动的数据高效双臂操作 — 仅需20分钟演示|从视频先验跨具身迁移视角

【论文分享】Vidar:Embodied Video Diffusion Model for Generalist Manipulation(arXiv 2025,清华 TSAIL×生数科技)。解耦视频生成与动作预测:750K 多平台视频预训练+统一观测空间+MIDM 隐式掩码,仅需 20 分钟演示(典型数据量 1%)即超越 SOTA 基线 40–58%,RoboTwin 多任务 65.8%。

文章图片
【arXiv 2025】LIBERO-PRO:超越记忆化的鲁棒公平 VLA 评测基准|从VLA鲁棒评测视角

【论文分享】LIBERO-PRO(arXiv 2025):四维扰动评测基准揭示 VLA 记忆化陷阱——标准 LIBERO 上成功率超过 90% 的 OpenVLA / Pi0 / Pi0.5,在位置与任务扰动下崩塌至 0.0%,证明高分源于训练布局记忆而非真实任务理解。

文章图片
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角

【RSS 2025】统一世界模型(UWM)论文解读:独立扩散时间步耦合视频与动作扩散,一个 DiT 同时实现策略/前向动力学/逆动力学/视频预测;真机 5 任务超越 Diffusion Policy 20%+,LIBERO-100 平均成功率 79% 达 SOTA。

文章图片
【ICML 2026 (Oral)】RoboMME 论文解读:首个大规模具身记忆评测基准,系统评估 VLA 长程记忆

RoboMME 是首个大规模标准化具身记忆评测基准:16 项非马尔可夫操控任务 × 4 种认知记忆维度(时序/空间/对象/程序)× 14 种 MME-VLA 变体。感知记忆 + Modulator 集成以 44.51% 成功率夺冠,远超无记忆基线 π0.5(17.93%)。

文章图片
#机器人#人工智能
深度学习图像数据增强部分笔记

图像色彩操作图像色彩调整亮度调整直接将彩色图像灰度化,也可以得到代表图像亮度的灰度图进行图像处理,计算量比 HSV 颜色空间变化低。但在 HSV 空间中进行处理可以得到增强后的彩色图像。饱和度调整对 HSV 空间的 S 分量进行处理可以实现对图像饱和度的增强。饱和度的调整通常是在 S 原始值上乘以一个修正系数。色调调整对 HSV 空间的 H 分量进行处理可以实...

文章图片
#深度学习#计算机视觉#图像处理
深度学习目标检测

一、基本概念1. 什么是目标检测目标检测(Object Detection)的任务是找出图像中所有感兴趣的目标(物体),确定它们的类别和位置,是计算机视觉领域的核心问题之一。由于各类物体有不同的外观、形状和姿态,加上成像时光照、遮挡等因素的干扰,目标检测一直是计算机视觉领域最具有挑战性的问题。计算机视觉中关于图像识别有四大类任务:(1)分类-Classification:解决“是什么?...

#计算机视觉#机器学习
深度学习基础 贰:损失函数与梯度下降

注:封面画师:新雨林-触站说明本页面无手机端适配,强制缩放阅读。使用纯html格式,保存教学用ppt,添加了部分个人笔记。目录工作正常,可以跳转。b{color:rgba(0,0,0,0.75)}损失函数与梯度下降损失函数与梯度下降损失函数损失函数的作用什么是损失函数梯度下降常用的损失函数什么是梯度梯度下降导数与偏导数学习率梯...

#算法#python#神经网络 +2
深度学习目标检测

一、基本概念1. 什么是目标检测目标检测(Object Detection)的任务是找出图像中所有感兴趣的目标(物体),确定它们的类别和位置,是计算机视觉领域的核心问题之一。由于各类物体有不同的外观、形状和姿态,加上成像时光照、遮挡等因素的干扰,目标检测一直是计算机视觉领域最具有挑战性的问题。计算机视觉中关于图像识别有四大类任务:(1)分类-Classification:解决“是什么?...

#计算机视觉#机器学习
    共 34 条
  • 1
  • 2
  • 3
  • 4
  • 请选择