
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要: 具身智能正从依赖人类遥操作的行为克隆(BC)转向具身强化学习(Embodied RL),以解决BC的复合误差累积与数据瓶颈问题。核心突破包括:1)利用视觉语言模型(VLM)自动生成奖励信号;2)结合Flow/Diffusion RL优化高维动作空间;3)通过“梦境试错”(Dream-to-Real)在WAM模型中高效训练策略,再迁移至真实机器人。双足人形机器人的全身协同控制(Loco-Ma
具身智能技术正从VLA范式转向WAM范式。VLA(Vision-Language-Action)依赖预训练视觉语言模型,通过“看图听话做动作”实现反应式控制,但缺乏对物理规律的显式建模。WAM(World Action Model)则通过视频预训练学习物理直觉,预测环境未来演化并反推动作,形成“先想象后行动”的因果驱动机制。WAM分为级联型(分步生成未来状态和解码动作)和联合型(紧耦合建模未来状态
具身视觉语言动作模型(VLA)技术综述摘要 本文系统调研了四种主流VLA模型(GraspVLA、SmolVLA、SwiftVLA和OpenVLA),从算法架构、应用场景、评价指标等方面进行对比分析。GraspVLA专注于物体抓取任务,采用解耦设计处理透明物体;SmolVLA面向边缘计算场景,实现轻量化部署;SwiftVLA优化高频实时控制;OpenVLA作为开源标杆,强调通用多任务能力。研究发现,

文章摘要 LeRobot是一个面向具身智能的端到端框架,旨在打通硬件、仿真与算法间的壁垒。系统架构采用分层设计:数据层基于HuggingFace实现高效存储与时间窗口采样;处理层提供多模态数据标准化;策略层统一各类算法的训练/推理接口;硬件层适配不同机器人平台。框架支持三种核心工作流:真实数据采集、离线评估和在线部署,并通过模块化设计便于扩展新策略模型或硬件设备。关键技术包括动作分块预测、数据归一

文章摘要: NotebookLM是一款功能强大的AI笔记工具,本文分享了9个高级使用技巧。核心建议是建立一个"Everything Notebook"主笔记本,集中存放各类重要资料,让AI深度了解用户。通过与Gemini联动,可以解决NotebookLM单独使用时的联网搜索、跨本调用和多模态输出限制。文章详细介绍了系统提示词和六大功能模块的定制方法,包括提示词撰写逻辑和范例模板。还提供了处理大容量
本文系统阐述 Gemini 3 高效使用策略,涵盖三大核心:1) 系统指令:提供包含六大模块的实战模版,建立全局抗干扰机制,确保输出精准个性化;2) 操作禁忌:针对原生推理特性,明确四大禁忌行为(参数调整、指令冗余、情绪勒索、格式混乱)及其负面影响;3) 幻觉规避:分析幻觉根源(奖励机制缺陷、顺从性偏误),提供三层防御策略(系统级约束、RAG与工具联动、交叉验证法),有效降低 Gemini 3 P
在2024年至2025年初的这段时间里,机器人学习(Robot Learning)领域经历了一场深刻的范式转移,其核心在于从针对特定环境、特定任务的“专家模型”向具备广泛泛化能力的“通才模型”(Generalist Policies)演进。这一转变的驱动力主要来自于大语言模型(LLM)和视觉语言模型(VLM)在互联网规模数据上的巨大成功。








