logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

金鑫博士的个人主页正式上线啦|技术博客 & 个人官网

金鑫博士华为云视频生成大模型、世界模型 团队主管中国科学院计算技术研究所 博士 | 华为云盘古多模态大模型首席架构师 · 华为技术专家A目前专注于大模型、人工智能与云计算领域,负责华为盘古视频生成基础模型、自动驾驶世界模型、具身世界模型、3D大模型、AR/VR、视频分析、OCR、机器学习平台、机器翻译等多个系统和服务。担任华为集团级大模型项目"4野15纵"视频生成技术负责人、华为集团级天水计划-A

文章图片
#人工智能
华为HDC大会2024张平安总keynote盘古多模态生成大模型:STCG技术如何重塑自动驾驶数据引擎

盘古5.0的STCG技术,正在从三个维度重塑自动驾驶开发范式:表格维度传统模式盘古STCG模式数据成本百万公里路测,人力物力高昂云端大规模并行生成,边际成本趋近于零场景覆盖依赖自然采集,长尾场景稀疏按需生成极端场景,实现"场景自由"标注精度人工标注存在误差与成本瓶颈生成过程自带完美标注(3D框、轨迹、语义分割)更重要的是,由于STCG生成的视频在几何一致性、物理合理性与视觉逼真度上均达到工业标准,

#华为#自动驾驶#人工智能
EgoLive:面向机器人操作学习的超大规模第一视角数据集

EgoLive数据集:真实场景人机交互数据新标杆 京东未来研究院提出的EgoLive数据集突破了机器人学习领域的数据瓶颈,成为当前最大规模的开源第一视角交互数据集。该数据集包含1,680小时立体视频(60FPS/2160P)、65,866个操作片段和346种真实任务,覆盖家庭服务、零售等多样化场景。 关键技术突破: 1️⃣ 专用采集设备:轻量化头戴设备JoyEgoCam支持130°超宽视场角,实现

文章图片
#机器人#学习#人工智能
Dexterity-BEV:跨本体&跨相机&Action三维空间对齐,推动通用机器人策略学习

摘要: Dexterity-BEV提出了一种创新框架,通过三维空间对齐技术解决机器人操作中二维视觉输入与三维物理交互的鸿沟。该框架采用对齐顶点图与顶点谱表示,构建规范化的鸟瞰图坐标系,统一多视角观测与异构机器人动作空间。实验表明,在仿真环境和四种真实机器人平台上,Dexterity-BEV显著提升了跨本体、跨视角的泛化能力,尤其在强扰动条件下保持近90%的任务成功率,验证了三维空间对齐对机器人策略

文章图片
#机器人#学习
混元Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到真实世界机器人学习全栈系统

腾讯发布端到端VLA系统HyVLA-0.5,打通机器人学习全链路 腾讯机器人实验室与混元团队联合推出HyVLA-0.5系统,实现了从数据采集到真实部署的完整机器人学习流程。该系统针对视觉-语言-动作(VLA)模型在实际应用中的三大挑战——数据、表征与部署,提出创新解决方案: 数据层:自研指尖级UMI采集设备,构建包含1万小时、70+任务的Hy-UMI-10K语料库,通过光学运动捕捉实现亚毫米级精度

文章图片
#机器人#学习#人工智能
看一遍人干活,机器人就会了:WAM-TTT 用测试时训练把人类视频“写进”世界动作模型

论文摘要: 北京大学、银河通用等机构联合提出WAM-TTT框架,通过测试时训练(Test-Time Training)将人类演示视频转化为轻量级快权重记忆,无需重定向或微调大模型即可让机器人适应新任务。该方法基于预训练的世界动作模型(WAM),仅需部署时观看人类视频,通过自监督学习更新视频侧快权重,冻结主干模型参数,保留泛化能力。实验在三种真实机器人(9个任务)上验证,在陌生家庭环境中平均任务进度

文章图片
#机器人#深度学习#人工智能
一万小时人类第一视角数据「喂」出的人形机器人大脑:Being-M0.7全身移动&操作隐式世界动作模型

摘要: Being-M0.7 是人形机器人移动操作(Loco-Manipulation)的新型潜在世界-动作模型,由 BeingBeyond 团队提出。其核心创新在于隐空间联合预测未来场景状态与全身动作,而非传统像素级预测,解决了数据稀缺、计算开销大和上下肢协调难题。模型通过混合万小时多模态数据预训练,结合轻量动作专家将预测转为可执行指令,在宇树 G1 机器人上实现了照镜抓取、水箱捞鱼等复杂任务。

文章图片
#机器人#人工智能#计算机视觉
Kairos:面向物理AI的原生世界模型栈

文章摘要: Kairos团队提出原生世界模型栈,推动世界模型从视频生成工具向物理AI基础设施升级。通过跨具身数据课程(CEDC)实现物理规律、行为语义与机器人控制的渐进式预训练;采用混合线性时序注意力架构统一理解、生成与预测功能,解决长时程状态维持难题;结合部署感知系统设计,在服务器与消费硬件上均实现高效推理。实验显示,该模型以更少参数达到多项基准最优性能,同时保持卓越推理效率,为自进化具身智能体

文章图片
#人工智能#机器人
DreamX-World 1.0:面向通用交互式世界建模的全栈技术实践

文章摘要: DreamX-World 1.0是一种通用交互式世界模型,支持多风格(真实、游戏、艺术)的长程视频生成,融合文本与图像驱动控制。其创新包括:1)多源数据引擎,整合虚幻引擎合成数据、游戏录制与真实视频,统一标注相机轨迹与事件;2)高效架构,提出E-PRoPE编码降低30%推理延迟,保留精确相机控制;3)长程一致性,通过几何引导记忆检索与残差循环机制维持场景稳定;4)事件交互,支持多实体组

文章图片
#人工智能#深度学习
世界模型评估新视角:面向具身决策的评估框架与协议

本文探讨了具身智能中世界模型的评估问题,指出当前研究存在术语泛化和评估标准不统一的现象。作者梳理了六类世界模型研究传统和四种评估文化,揭示了声明与证据之间的错位问题,即低层级评估指标常被错误用于支撑决策效用的高层级声明。基于此,研究提出了从L0(视觉合理性)到L7(策略优化效用)的评估阶梯框架,强调应根据模型的实际用途选择合适的评估层级。该工作为世界模型研究提供了系统化的方法论指导,有助于解决评估

#人工智能#深度学习#计算机视觉
    共 77 条
  • 1
  • 2
  • 3
  • 8
  • 请选择