logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

最大预训练具身世界模型τ0-WM:面向机器人操作任务的统一视频-动作世界模型

上海人工智能实验室与AGIBOT Finch团队提出的τ0-World Model(τ0-WM)创新性地整合了视频预测、动作生成与评估功能,通过共享视频扩散骨干网络实现了多源异构数据的联合训练。该模型在27,300小时的机器人遥操作、UMI式演示和人体交互视频数据上进行训练,采用统一监督掩码机制处理不同数据源的差异。τ0-WM包含视频动作模型(VAM)和动作条件化视频模拟器(ACVS)双分支,分别

文章图片
#机器人#音视频#人工智能
华为HDC大会2024张平安总keynote盘古多模态生成大模型:STCG技术如何重塑自动驾驶数据引擎

盘古5.0的STCG技术,正在从三个维度重塑自动驾驶开发范式:表格维度传统模式盘古STCG模式数据成本百万公里路测,人力物力高昂云端大规模并行生成,边际成本趋近于零场景覆盖依赖自然采集,长尾场景稀疏按需生成极端场景,实现"场景自由"标注精度人工标注存在误差与成本瓶颈生成过程自带完美标注(3D框、轨迹、语义分割)更重要的是,由于STCG生成的视频在几何一致性、物理合理性与视觉逼真度上均达到工业标准,

#华为#自动驾驶#人工智能
华为开发者大会2025HDC|“盘古大模型关键技术解读”直播 (Part.2-盘古世界模型:GenJi & 金鑫博士)

盘古世界模型深度解读:当STCG遇见4D空间,华为如何用"物理引擎+数据驱动"重构自动驾驶仿真范式

#华为#服务器#unix
从秀场到产线:WRC2026 具身智能11大场景与技术全景

WRC2026是具身智能产业发展的一个重要里程碑。具身智能的"试用期"正在结束,行业正从技术验证期进入产品化落地期。工业搬运、零售拣选、餐饮服务等场景已具备小批量商用条件;具身大模型、灵巧手、数据采集等底层技术快速迭代;轮式人形成为落地首选形态。但同时也要清醒地看到,当前的"能干活"更多是在半结构化、预定义场景中的有限能力。真正的通用具身智能——能够在任意非结构化环境中自主理解任务、规划多步骤操作

文章图片
#人工智能#机器人
GigaBrain-0.7:三系统架构驱动的具身智能新范式

GigaBrain-0.7 通过三系统架构与大规模异构数据预训练,为具身基础模型的发展提供了一条可扩展的技术路径。其在理解、预测与执行层面的深度协同,不仅提升了模型在单一任务上的执行精度,更重要的是赋予了模型跨本体、跨任务与跨场景的通用性与适应性。从 37000 小时异构数据中的预训练,到世界模型驱动的后训练,再到基于 rollout 经验的持续强化,GigaBrain-0.7 展示了一个具身智能

文章图片
#人工智能#机器人
GEN-1.5:具身基础模型迈入One-Shot学习时代

GEN-1.5的发布标志着具身基础模型领域的一个重要转折点。它证明了在足够规模的物理交互数据预训练下,机器人可以像大语言模型理解文本一样,通过上下文学习理解物理任务。从单个演示中学习新技能的能力,从仿真到现实的零样本迁移,以及面对新工具时的即兴创造,这些能力的组合勾勒出了一个令人期待的愿景:未来的机器人将不再是需要数月编程的专用设备,而是能够像人类一样通过观察和学习快速掌握新技能的通用智能体。这一

文章图片
#机器人#深度学习
世界模型WM与具身世界动作模型WAM:从基础仿真器到具身智能的统一技术图景

本文综述了具身世界动作模型(WAM)的最新进展,系统梳理了六大技术支柱:基础世界模型、视觉-语言-动作(VLA)模型、具身WAM、自动驾驶世界模型、效率与评测、数据集与生态。研究显示,世界模型正从被动视频预测器演进为可交互的物理仿真器,而VLA模型则建立了连接语义意图与运动控制的桥梁。二者的融合催生了WAM这一新型架构,使智能体能够通过"想象"未来状态来规划动作。文章重点分析了

文章图片
#人工智能
金鑫博士的个人主页正式上线啦|技术博客 & 个人官网

金鑫博士华为云视频生成大模型、世界模型 团队主管中国科学院计算技术研究所 博士 | 华为云盘古多模态大模型首席架构师 · 华为技术专家A目前专注于大模型、人工智能与云计算领域,负责华为盘古视频生成基础模型、自动驾驶世界模型、具身世界模型、3D大模型、AR/VR、视频分析、OCR、机器学习平台、机器翻译等多个系统和服务。担任华为集团级大模型项目"4野15纵"视频生成技术负责人、华为集团级天水计划-A

文章图片
#人工智能
华为HDC大会2024张平安总keynote盘古多模态生成大模型:STCG技术如何重塑自动驾驶数据引擎

盘古5.0的STCG技术,正在从三个维度重塑自动驾驶开发范式:表格维度传统模式盘古STCG模式数据成本百万公里路测,人力物力高昂云端大规模并行生成,边际成本趋近于零场景覆盖依赖自然采集,长尾场景稀疏按需生成极端场景,实现"场景自由"标注精度人工标注存在误差与成本瓶颈生成过程自带完美标注(3D框、轨迹、语义分割)更重要的是,由于STCG生成的视频在几何一致性、物理合理性与视觉逼真度上均达到工业标准,

#华为#自动驾驶#人工智能
EgoLive:面向机器人操作学习的超大规模第一视角数据集

EgoLive数据集:真实场景人机交互数据新标杆 京东未来研究院提出的EgoLive数据集突破了机器人学习领域的数据瓶颈,成为当前最大规模的开源第一视角交互数据集。该数据集包含1,680小时立体视频(60FPS/2160P)、65,866个操作片段和346种真实任务,覆盖家庭服务、零售等多样化场景。 关键技术突破: 1️⃣ 专用采集设备:轻量化头戴设备JoyEgoCam支持130°超宽视场角,实现

文章图片
#机器人#学习#人工智能
    共 84 条
  • 1
  • 2
  • 3
  • 9
  • 请选择