
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文将深入 RDA 的代码实现,详细解析 idle 检测的算法细节,包括 bimodal gap detection 的具体实现、MAD 回退机制,以及 action discontinuity 的 spike 检测方法。表格算法适用场景局限性动静分明的 manipulation task全程缓慢操作时失效MAD 回退单峰分布,作为兜底方案可能过于保守检测 action 突变点对高频噪声敏感RDA
最近在审计一批 LeRobot 格式的机器人数据集时,遇到了视频冻结问题。本文分享 RDA 的视频冻结检测方案、实现思路和实测结果。
本文基于 RDA v0.9.7 对 13 个 LeRobot 公开数据集的全量审计结果,详细解读四层审计框架的每层指标含义、跨数据集对比、以及 v0.9.7 判定管线重构的工程决策。
摘要: 本文介绍了如何使用TLabel工具将TacQuad触觉数据集(包含4种传感器、671个episode、104,576帧)转换为统一标注格式。TLabel解决了多传感器触觉数据标注不统一的问题,支持17维特征(如接触标志、力大小、滑移熵等)和语义标签的标准化输出。教程详细演示了环境配置、数据转换逻辑(通过tacquad_to_tlabel.py脚本)、数据结构验证及下游任务实验复现,包括跨传

元信息:工具· 数据集(LeRobot v3.0 格式,379 个演示片段,101,469 帧)· 纯 CPU 运行 · 2026-09-03如果你在用 libero_10 做 VLA 或模仿学习实验,大概率对它的 10 个任务、每个任务 35–49 条轨迹很熟悉了。但「这批数据本身质量如何」这个问题,很多人(包括我们自己)通常是凭感觉回答的。最近我们在给自己的开源审计工具 RDA 做 0.5.8
当北京人形机器人创新中心发布 RoboMIND 2.0 时,我第一次看到了大规模触觉数据的标准化可能性。这篇文章记录了我用 TLabel 对 RoboMIND AgileX 数据集进行标注测试的全过程——从 1.4GB HDF5 文件到质量评分,从 Tashan 传感器适配到 14 维 Schema 映射。
大多数检查工具要么要求你把数据传到别人服务器,要么本地跑一半还要联网调 API。可真实场景是——机器人数据经常躺在内网的采集机上,标注公司的环境根本不出网。其实要检查的问题并不复杂:有没有空 episode?有没有连续几百帧一模一样的"冻结帧"?昨天的 0.5.5 版本补上了最后一块:断网环境下优化建议也能本地生成,不依赖任何服务器。RDA 做的事情就一件:一条命令,扫完给你一份报告,每个问题都标
背景:机器人操作数据集的质量直接影响模仿学习与 VLA 类模型的训练效果。当前社区存在多种开源质量评估工具,但它们分别从不同维度定义「质量」,其结论是否可比、能否互相替代,缺乏系统的实证材料。方法:本研究将三个公开 LeRobot 格式数据集(
本文介绍面向 LeRobot 格式的开源机器人数据审计工具 RDA(Robot Data Audit)。RDA 通过 13 项分层指标对每个 episode 进行自动化检查,输出 PASS/REVIEW/EXCLUDE 三档裁决,帮助用户在训练前发现数据质量问题。文章详细解析了 RDA 的安装使用、指标设计原理,并展示了在 12 个 LeRobot 数据集上的实测结果:4,959 个 episod
本文对11个公开LeRobot格式数据集(共4,909条episode)进行了全面审计,覆盖仿真/真机、脚本/人工操作等多种场景。审计发现:1)多数数据集存在高空闲率(中位数20.8%-93.3%),影响训练偏差;2)动作尖峰与控制器强相关;3)同一硬件在不同任务中空闲率差异显著;4)所有数据集基础完整性良好,但45%-98%需行为层复核。特别指出,低成本硬件可能产生高质量数据。审计工具RDA可检








