logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

LARYBench 评测标准解读:潜动作表征应当如何被系统评估

LARYBench 是一套面向潜动作表征的标准化评测基准,目标不是直接比较某个机器人系统的任务成功率,而是先回答一个更基础的问题:从视频中抽取出来的潜动作,是否真的包含了足够稳定、足够可泛化、足够可用于控制的动作信息。围绕这个问题,LARYBench 把评测拆成两个维度,一是高层语义理解,也就是模型能否区分不同动作类别;二是低层物理控制,也就是模型能否从潜空间中恢复出末端执行器轨迹。

文章图片
#人工智能
Loco-Manipulation:机器人移动与操作协同的技术演进

文章摘要:Loco-Manipulation技术综述 Loco-Manipulation(移动操作协同)是机器人技术领域的重要突破,旨在实现移动平台与机械臂的深度协同控制,打破传统"先移动后操作"的割裂模式。该技术面临三大核心挑战:动态耦合的复杂性、实时性与计算复杂度的矛盾,以及泛化能力与数据效率的权衡。目前主要有模型驱动和学习驱动两条技术路径:模型驱动方法基于精确物理建模,通过优化算法实现高精度

文章图片
#机器人#java#开发语言
从 OpenClaw 到 Claude Code:AI 代理框架的技术解构与产业真相

真正有用的是把 Claude 的默认行为推到你需要的方向——不管是设计品味、组织规范,还是特定的边界情况。Thariq 举了一个 Anthropic 内部的"设计品味 Skill"的例子:一个工程师通过反复和客户迭代,让 Claude 避免常见的设计陋习(比如 Inter 字体加紫色渐变),形成了一套独到的设计偏好库。这让 Skill 有了跨会话的记忆。更值得关注的是,OpenClaw 的长短期记

文章图片
#人工智能
四足机器人开源项目深度解析:从入门到研究级的完整技术图谱

(支持地形课程学习、多模态感知、分层控制等复杂训练场景)。

文章图片
#机器人#开源
触觉传感与世界模型:机器人从“被动感知“到“主动预测“的技术革命

在这种任务里,纯策略模型很可能会输出一个"最像训练数据示范"的抓取动作,但它的问题在于,系统并没有显式判断这个动作会带来什么后果。同时,触觉数据的采集频率通常高于视觉数据,如何在不同频率的多模态数据之间建立有效的时间对齐和融合机制,也是一个重要的技术问题。当我们说一句"把桌上的杯子洗了",机器人之所以能够理解"杯子"“桌上”"洗"这些开放语义,并进一步调动已有技能,很大程度上依赖的就是VLA这类模

文章图片
#机器人#microsoft
RL Tokens:让机器人在“最后一毫米“突破的在线强化学习方案

传统思路是"如何让整个 VLA 模型变得更强",而。

文章图片
#机器人
CeRLP:面向跨形态机器人视觉导航的统一局部规划框架

移动机器人导航是机器人学中最基础也最关键的能力之一。无论是仓储物流中的自主搬运车、灾难救援中的探测机器人,还是家庭服务场景中的扫地机器人,都需要在复杂环境中找到一条安全可行的路径到达目标位置。传统的导航方法,如动态窗口法(DWA)和时间弹性带(TEB),虽然在工程实践中被广泛使用,但它们严重依赖预先构建的精确地图,一旦环境发生变化或地图不可用,导航性能就会急剧下降。近年来,深度强化学习(DRL)为

文章图片
#机器人#计算机视觉
OpenClaw 与机器人相关项目全景综述

更准确的理解方式,是把这些项目放回同一条技术链上:上层是自然语言与多通道入口,中层是技能、状态、协议与安全控制,下层才是 ROS2、仿真、机械臂接口、电机控制器和嵌入式运行时。作为生态底座,OpenClaw 当前已经不是一个简单的命令行代理,而是一个多通道 Gateway,可以把 WhatsApp、Telegram、Slack、Discord、WebChat、移动节点和本地工具统一接到同一个长期运

文章图片
#机器人
DualMap 如何把开放词汇语义建图接到自然语言导航

DualMap 是一个面向在线机器人运行的开放词汇语义建图系统。它关心的问题不是“把一张图片分成若干固定类别”,而是让机器人在移动过程中持续维护一份对象级地图,并能用自然语言查询地图中的目标。DualMap 论文页面将系统概括为 online open-vocabulary mapping,强调开放词汇理解、在线高效建图和动态变化环境中的语言引导导航。放到工程实现里看,这三个目标分别对应视觉语言前

文章图片
#人工智能
    共 699 条
  • 1
  • 2
  • 3
  • 70
  • 请选择