logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

π0.5论文阅读

4、推理时,模型首先为机器人生成要执行的高级子任务,然后基于该子任务,通过动作专家预测低级动作。(仿佛不是端到端,更像是训练了两个模型,上层是视觉语言模型,下层是语言动作模型,但其实不是,这两个共享同一个神经网络,模型既完成了对任务的分解,又完成了基于子任务的动作输出)推理时,模型先推理出高层子任务,再基于该子任务预测动作。6、高级子任务预测,将高层级任务指令(打扫卧室)拆解为(整理毯子、捡起枕头

#论文阅读
π0VLA论文阅读

3、对数据内容进行的处理:将机器人的关节角度状态q与预测动作设置为训练过程中维度最大的机器人一致,实验中是18维(机器人关节角度和预测动作的维度是相同的,理论上机器人有多少关节就应预测多少个关节的动作)。ai的回答是动作属于整个token,不同的维度数据属于token内部的形态,如果对token内部mask,模型会学习到错误的输入输出维度,导致损失计算时发生错误,但是为了避免模型学习到维度数据为0

#深度学习#人工智能#机器人
OpenVLA论文阅读

4、图像分辨率,输入图像的分辨率对VLA训练的计算需求有显著影响,因为更高分辨率的图像会产生更多图像块标记,从而导致上下文长度更长,训练计算量呈二次方增长。1、使用LoRA(低秩适配)进行微调,指针对模型中的所有线性层进行微调,并尝试了不同的秩,实验显示,使用 LoRA 微调的 OpenVLA 在下游任务上的成功率与全量微调几乎一致(甚至在某些任务上略好),但显存占用和计算需求大幅降低。3、数据处

#人工智能#机器人
基于pyqt5的图书管理系统(python)(开源)

图书管理系统代码开源(python),基于pyqt5开发,代码结构整洁有序,主要实现功能有:进阶功能:人脸识别注册登录、二维码扫描录入图书信息、YOLOv10检测。基本功能:基于数据库的注册登录、图书增删查改、爬取豆瓣图书进行推荐、图书借阅、催还、管理员公告、反馈交流等功能。

文章图片
#python#视觉检测#pyqt
基于pyqt5的图书管理系统(python)(开源)

图书管理系统代码开源(python),基于pyqt5开发,代码结构整洁有序,主要实现功能有:进阶功能:人脸识别注册登录、二维码扫描录入图书信息、YOLOv10检测。基本功能:基于数据库的注册登录、图书增删查改、爬取豆瓣图书进行推荐、图书借阅、催还、管理员公告、反馈交流等功能。

文章图片
#python#视觉检测#pyqt
到底了