logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

具身智能论文问答(四):pi0

是“离散词汇”的拼接(VLM 架构,无法连贯)。

#人工智能#算法
论文翻译:TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based

基于大视觉语言模型(LVLM)的技术最新进展,催生了多种技术范式下的大视觉语言模型驱动式图形用户界面(GUI)智能体。以 CogAgent 与 SeeClick 为代表的基于训练的技术方案,因依赖特定数据集开展训练,存在跨数据集与跨平台泛化能力薄弱的问题。:译为跨数据集与跨平台泛化能力)以 GPT-4V 为代表的通用型大视觉语言模型(LVLM),采用标记集合(Set-of-Marks, SoM)技

#人工智能
大话机器学习-1.神经网络

神经网络是一层一层组织起来的一个层状结构。简单来说,就是由输入层,隐藏层,输出层组成。用于接受数据,节点数等于输入特征的维度。也就是神经网络进行思考的地方。就是产生预测结果。神经网络最重要的一个步骤就是学习,那么他是如何学习呢?实质上就是重复“进行前向传播计算损失函数进行反向传播进行更新权重”,从而重复“反向传播”从而的得到最优参数。

#机器学习#神经网络#人工智能
Agent系列(一):主流架构

是一种能够自主感知环境、做出决策并采取行动的智能实体。是一种预定义的、线性的任务执行流程,旨在自动化和优化特定业务流程。中每个智能体都是具备独立思考和决策能力的自主实体。实现真正的智能协作。相比之下,更像是一个"精密的生产线",通过预定义的流程节点和条件分支,实现业务流程的自动化执行。在面对极其复杂或步骤繁多的任务,多 Agent 系统会将其拆解为若干个易于处理的子任务。系统内的每个 Agent

#架构
具身智能论文精读(一):Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots

该结果表明,仅使用窄域数据微调大预训练模型,不足以得到可在真实野外场景部署的机器人策略。因此,采集多样化的开放式真实场景数据,对于模型适配全新环境与未知物体、实现有效泛化依然至关重要。

#人工智能
具身智能论文精读(七):Pi0.5

若要让机器人真正具备实用价值,就必须走出实验室,在真实物理世界中完成各类实际应用任务。尽管视觉 - 语言 - 动作(VLA)模型在机器人端到端控制上已取得亮眼效果,但这类模型在真实野外场景中的泛化能力上限,仍是一个尚未解决的开放性问题。本文提出。

#人工智能#算法
KG与LLM:大模型时代的智能规划

LLM可以利用自然语言指令,利用海量常识知识,生成类人的推理过程。

#人工智能
具身智能论文精读(三):Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware(ACT)

精细操作任务依赖高精度闭环反馈,需要机器人具备极强的手眼协调能力,从而根据环境变化实时调整动作、重新规划轨迹。此类操作任务的例子包括打开调味杯盖或安装电池,这些操作涉及精细的操作,如捏合、撬开和撕裂,而非像挑选和放置这样的大动作。以图 1 中打开调料杯盖为例:杯子初始竖直放置在桌面,右侧夹爪需要先将杯子放倒,再推送至左侧张开的夹爪内;然后左侧的夹爪轻轻合上,将杯子从桌上抬起。接着,右手一根手指从下

#人工智能
    共 49 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择