
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
前一段时间写过关于openvla的文章,openvla是基于VLM的多模态模型,本质上基于成熟的大语言模型来预测action。本文的RDT-1B是另一种路线,是基于diffusion扩散模型,可以经过多步forward,不断的去噪,生成更加精细的action。关于RDT-1B的详细技术原理,已经有很多篇不错的文章了,本文也不再赘述,可以自行检索。RDT-1B代码其实并不复杂,但涉及的背景知识比较多

但在技术实现中其实是一致的,大家可以将一终图片看成一段视频,不过此段视频只有第一帧是有效的,后续的视频片段全是零。在上文的case中,整体输入[1, 3, 81, 464, 832],bs=1,3代表rgb三通道,81代表帧数(稍后会详述),464*832是分辨率。最近在研究具身领域的世界模型,读到一个蚂蚁灵波的lingbot va系列的模型,想来复现一下,其中lingbot va1.0就是基于w
如果使用过mmdetection框架的同学应该能感受到框架的每一个部分都是组件,例如backbone,head,loss等等,训练的核心就是一个配置文件,通过配置文件把各部分扁平的组合在一起。个人感受,欢迎大家一起讨论。Senna是在Llava基础之上的工作,是基于Llava的代码二次开发,网络结构没有变化,所以可以理解Senna==Llava,所以可以看到Senna中一方面把Llava的一些成员

原文发表在知乎,辛苦移步:《最近一直在看强化学习算法,跑起来的demo模型都很小,(例如:《具身智能hil-serl强化学习算法在lerobot机械臂上复现》)所以可以在单机上很容易跑起来。但针对具身智能的VLA模型,可能动辙就是几个B的参数量,如果只是模仿学习的话,也有很多分布式训练框架,例如deepspeed, fsdp等可很方便的引入,这样多卡/多机训练也很简单。
原始文章发表在知乎,辛苦移步~最近把hil-serl在lerobot机械臂上跑了一下,网上也没找到其他同学的成功的复现分享,所以笔者一路过关斩将解决问题,在此记录一下,希望对大家也能有所帮助。hil-serl是2024年底的一篇文章,作者罗剑岚目前是智元的首席科学家。整体来看,其实hil-serl的思想挺简单的:传统在在线强化学习采样过程可能是算法驱动的,例如随机探索,这样效率比较低,训练时长会较
最近在看具身智能领域一些代表性的模型,openvla是2024年中出的一个vla模型,详细的学习了一下,这个文章在工程实现方面写得还是非常详尽的(代码中的README和论文本身),包括环境安装,全量微调,lora微调,模型格式转换,甚至在效果不好时如何一步一步排查也写了,感觉作者是很用心的,值得我们学习。openvla模型比较经典,网络上的解读文章也比较多了,我在文末也列了2个,仅供参考。简单来说

看到pi0.5后,第一个会想到的是,它与pi0(π0模型前向推理过程详解, π 0模型数据-训练-评测过程)相比的升级点在哪里。它有一个state_proj层,用于将状态向量投影到模型的嵌入空间中,与50维action chunk拼在一起,形成一个51维的embedding,然后在action expert中使用。大概半年前学习过pi0与pi0.5模型,那时候pi0.5还没有开源,现在pi0.5开
原文发表在知乎,辛苦移步:《有一定影响力的知名微信公众号也申请了转载,还有很多微信网友加了好友咨询,也了解到了最少有两名网友也基于笔者的代码成功复现。笔者发表文章的初衷首先是在学习的过程中作为一个笔记的记录,时时的回顾总结;其次笔者常常读一些优秀的论文,文章,开源项目代码,经常性的会感慨正是大家的开源奉献精神,才能让后人站在巨人的肩膀之上做出更多创新,所以也希望自己在吸收知识的同时能有少量输出。看
最近几天将pi0.5模型训练并在物理lerobot机械臂上跑了一下,过程如下:采数据命令:}’
原文发表在知乎,辛苦移步:《有一定影响力的知名微信公众号也申请了转载,还有很多微信网友加了好友咨询,也了解到了最少有两名网友也基于笔者的代码成功复现。笔者发表文章的初衷首先是在学习的过程中作为一个笔记的记录,时时的回顾总结;其次笔者常常读一些优秀的论文,文章,开源项目代码,经常性的会感慨正是大家的开源奉献精神,才能让后人站在巨人的肩膀之上做出更多创新,所以也希望自己在吸收知识的同时能有少量输出。看







