logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

具身智能前沿报告:具身强化学习(Embodied RL)、梦境自主试错与全身协同控制(Loco-Manipulation)

摘要: 具身智能正从依赖人类遥操作的行为克隆(BC)转向具身强化学习(Embodied RL),以解决BC的复合误差累积与数据瓶颈问题。核心突破包括:1)利用视觉语言模型(VLM)自动生成奖励信号;2)结合Flow/Diffusion RL优化高维动作空间;3)通过“梦境试错”(Dream-to-Real)在WAM模型中高效训练策略,再迁移至真实机器人。双足人形机器人的全身协同控制(Loco-Ma

#人工智能#机器学习#深度学习 +2
具身智能(Embodied AI)技术演进与前沿报告:从 VLA 到 WAM 的范式跃迁

具身智能技术正从VLA范式转向WAM范式。VLA(Vision-Language-Action)依赖预训练视觉语言模型,通过“看图听话做动作”实现反应式控制,但缺乏对物理规律的显式建模。WAM(World Action Model)则通过视频预训练学习物理直觉,预测环境未来演化并反推动作,形成“先想象后行动”的因果驱动机制。WAM分为级联型(分步生成未来状态和解码动作)和联合型(紧耦合建模未来状态

#人工智能
具身视觉语言动作模型(VLA)技术综述调研

具身视觉语言动作模型(VLA)技术综述摘要 本文系统调研了四种主流VLA模型(GraspVLA、SmolVLA、SwiftVLA和OpenVLA),从算法架构、应用场景、评价指标等方面进行对比分析。GraspVLA专注于物体抓取任务,采用解耦设计处理透明物体;SmolVLA面向边缘计算场景,实现轻量化部署;SwiftVLA优化高频实时控制;OpenVLA作为开源标杆,强调通用多任务能力。研究发现,

文章图片
#人工智能
LeRobot 项目架构概览

文章摘要 LeRobot是一个面向具身智能的端到端框架,旨在打通硬件、仿真与算法间的壁垒。系统架构采用分层设计:数据层基于HuggingFace实现高效存储与时间窗口采样;处理层提供多模态数据标准化;策略层统一各类算法的训练/推理接口;硬件层适配不同机器人平台。框架支持三种核心工作流:真实数据采集、离线评估和在线部署,并通过模块化设计便于扩展新策略模型或硬件设备。关键技术包括动作分块预测、数据归一

文章图片
#架构#人工智能
9个NotebookLM高级技巧

文章摘要: NotebookLM是一款功能强大的AI笔记工具,本文分享了9个高级使用技巧。核心建议是建立一个"Everything Notebook"主笔记本,集中存放各类重要资料,让AI深度了解用户。通过与Gemini联动,可以解决NotebookLM单独使用时的联网搜索、跨本调用和多模态输出限制。文章详细介绍了系统提示词和六大功能模块的定制方法,包括提示词撰写逻辑和范例模板。还提供了处理大容量

#googlecloud
Gemini 3 深度使用指南:系统指令、禁忌事项与幻觉规避

本文系统阐述 Gemini 3 高效使用策略,涵盖三大核心:1) 系统指令:提供包含六大模块的实战模版,建立全局抗干扰机制,确保输出精准个性化;2) 操作禁忌:针对原生推理特性,明确四大禁忌行为(参数调整、指令冗余、情绪勒索、格式混乱)及其负面影响;3) 幻觉规避:分析幻觉根源(奖励机制缺陷、顺从性偏误),提供三层防御策略(系统级约束、RAG与工具联动、交叉验证法),有效降低 Gemini 3 P

#AIGC
2024-2025年视觉-语言-动作(VLA)模型前沿研究报告

在2024年至2025年初的这段时间里,机器人学习(Robot Learning)领域经历了一场深刻的范式转移,其核心在于从针对特定环境、特定任务的“专家模型”向具备广泛泛化能力的“通才模型”(Generalist Policies)演进。这一转变的驱动力主要来自于大语言模型(LLM)和视觉语言模型(VLM)在互联网规模数据上的巨大成功。

文章图片
#架构#语言模型#计算机视觉
到底了