logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Zero-WAM——基于人类视频的上下文世界-动作建模:面对未见任务,给一段人类示范视频作为prompt,不微调直接输出对应的机器人未来视频和可执行动作

本文提出Zero-WAM,一种基于人类视频的上下文学习机器人模型,实现零样本跨任务泛化。通过构建HumanGen数据集(8.6K任务,74.2K人机配对样本),利用机器人轨迹自动生成语义匹配的人类视频,解决数据稀缺问题。创新性提出“上下文未来片段预测”(IFP)训练目标,迫使模型依赖视频提示而非捷径,提升对未见任务的泛化能力。该工作推动具身智能向大模型时代迈进,验证了大模型在机器人领域的强大潜力。

文章图片
π∗0.6——通过RL框架RECAP微调流式VLA π0.6:先基于示教数据做离线RL预训练,再SFT(即IL微调),最后在线RL后训练(与环境自主交互,从经验数据中学习,且必要时人工干预)

摘要: π0.6是PI公司提出的新一代视觉-语言-动作(VLA)模型,通过强化学习(RL)从自主经验中提升性能。其核心框架RECAP结合了离线RL预训练、在线数据采集与专家干预,利用分布式价值函数评估任务进展,并通过优势条件策略优化动作选择。实验表明,该方法在复杂任务(如折叠衣物、制作咖啡)中使吞吐量提升2倍以上,失败率降低50%,实现了长时间稳定运行。相比传统模仿学习或策略梯度方法,π0.6通过

文章图片
BeyondMimic——从跳舞好手到通过引导扩散实现多功能控制:基于Diffuse-CLoC构建扩散框架,可模仿动作、导航避障(含我司复现实践)

UniTracker是一个用于人形机器人全身运动跟踪的统一框架,通过集成条件变分自编码器(CVAE)来增强动作多样性和全局一致性。该框架采用三阶段训练:基于特权观测的教师策略训练、部分观测的学生策略学习,以及针对特定动作的快速微调。研究团队从AMASS数据集中筛选并重定向动作数据,使用SMPL模型参数表示人体动作,并通过两阶段方法将其适配到机器人模型。相比传统方法,UniTracker能更好地处理

文章图片
一文通透Qwen LLM系列——从Qwen、Qwen1.5、Qwen2、Qwen2.5到Qwen3(融合了chat和推理)、Qwen3 MoE

通义千问Qwen3系列大模型在架构、训练和数据方面实现全面升级。该系列包含6个稠密模型和2个MoE模型,其中2350亿参数的旗舰模型Qwen3-235B-A22B在多项基准测试中超越同类产品。模型采用分组查询注意力、SwiGLU等先进架构,通过三阶段预训练(通用、推理、长上下文)处理36万亿token的多语言数据。后训练创新性地引入"思维控制"和"强到弱蒸馏&quot

文章图片
实时动作分块RTC——为解决高延迟,让π0.5也可以点燃火柴、插入网线:执行当前动作分块时生成下一个分块,且已执行的冻结并通过“图像修复”引导新块的生成

摘要 Physical Intelligence公司提出了一种实时动作分块技术(RTC),解决了视觉-语言-动作模型(VLA)在高精度任务中的延迟问题。该技术将异步动作分块建模为修补问题,在执行前一个动作块的同时生成下一个兼容的动作块,有效避免了传统分块方法在切换点产生的不连续性。RTC适用于基于扩散或流的可变长度动作模型,无需改变现有训练流程。实验表明,该方法能实现连续稳定的控制信号,支持如点燃

文章图片
LeRobot pi0——LeRobot对VLA策略π0的封装:含其源码剖析与真机部署(效果上逊于官方openpi)

本文详细剖析了LeRobot框架中π0模型的实现与优化。π0是一个结合视觉-语言-动作的多模态模型,用于通用机器人控制,核心包括: 架构设计 基于PaliGemma视觉语言模型与Gemma专家模型的融合 采用流匹配技术生成机器人动作序列 支持分组查询注意力(GQA)优化推理效率 关键实现 转换工具:将JAX实现的模型转换为PyTorch格式 配置系统:统一管理输入/输出结构、归一化策略和训练参数

文章图片
π0.5——推理加强的统一模型:先高层预训练离散化token自回归预测子任务、后低层执行子任务(实时去噪生成连续动作)

今天一早,朋友圈刷到π0出0.5版本了,之后,我组建的「七月具身:π0复现微调交流群」群中,也在讨论这事,并说:七月老师要更新博客了这不就来了现在具身模型的发展 还不如大语言模型那样成熟π0 发新版了,意味着和Google的RT(大概率是不更了),以及figure(没开源过)等等——还有别的一些模型 没列举全,进入了少数迭代型的具身模型的行列。

文章图片
宇树VR遥操与IL——从遥操程序xr_teleoperate到unitree_IL_lerobot:如何基于G1进行manipulation开发

如之前的文章所述,我司「七月在线」正在并行开发多个订单,目前正在全力做好每一个订单,因为保密协议的原因,暂时没法拿出太多细节出来分享​但可以持续解读我们所创新改造或二次开发的对象,即解读paper和开源库「当然 有些paper/库还没开始用,但也可以提前解读,作为关注了解而对于我司人形开发的订单,背后的机器人多半基于这三家:宇树、傅利叶、乐聚且无论咱们是用傅利叶集成的lerobot——,还是宇树集

文章图片
π0的微调——如何基于各种开源数据集、以及私有数据集微调openpi(含我司七月的微调实践及openpi在国产臂上的部署)

25年2.4日,几个月前推出π0的公司Physical Intelligence (π)宣布正式开源π0及π0-FAST,如之前所介绍的,他们对用超过 10,000 小时的机器人数据进行了预训练该GitHub代码仓库包括4个方面:简言之,就是π0本身的代码和权重、特定平台上特定任务的微调checkpoint、推理代码、微调代码。

文章图片
π0源码(openpi)剖析——从π0模型架构的实现:如何基于PaLI-Gemma和扩散策略去噪生成动作,到基于C/S架构下的模型训练与部署

ChatGPT出来后的两年多,也是疯狂写博的两年多,年初deepseek更引爆了下从曾经15年创业后每年2-6篇的,干到23年30篇、24年65篇,25年前两月18篇,成了我在大模型和具身的原始技术积累如今一转眼已到25年3月初,纪念这两年多,然近期和团队接了好几个大客户订单,使得3月起 不得不全力加速落地,自己也得每天抠paper、搞代码,今年可能没法像去年那样干65篇,不过,我还是争取保持月月

文章图片
    共 528 条
  • 1
  • 2
  • 3
  • 53
  • 请选择