logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

《WAM 系列》Zero-WAM | 人类视频上下文学习 | 未来片段预测 | 零样本跨任务泛化

机器人面对一个训练中从未出现的任务时,真正缺少的往往不是一句更长的语言指令,而是一份能展示目标对象、操作过程和执行顺序的任务说明。Zero-WAM 把人类示范视频当作部署时的上下文提示:模型不更新参数,也不要求为新任务采集机器人演示,而是先根据人类视频生成下一段机器人视频,再把预测的视觉变化解码为可执行动作。:官方仓库当前仅包含 README、许可证与网页素材;代码、模型和数据计划在 2026-0

文章图片
#人工智能
多目标跟踪算法FairMOT

1 引言FairMOT从以下角度分析了此前方法的缺陷,Unfairness Caused by Anchors1、忽略了re-ID任务。Track R-CNN以级联的方式连接检测模型和re-ID模型,因此re-ID特征的质量很大程度取决于目标检测产生的边界框的质量;2、一个anchor对应多个ID;3、多个anchor负责一个ID.Unfairness Caused by Features对于on

#目标跟踪#目标检测#深度学习
python使用dlib库进行人脸关键点检测

本文记录了使用dlib库中的函数进行人脸关键点检测的方法

文章图片
#人工智能#计算机视觉#opencv
GR00T N1.7源码学习(四):微调流程、训练Pipeline与Checkpoint保存机制解析

本文继续分析GR00T N1.7的微调工程流程,主要关注训练任务本身的运行机制。

#人工智能#深度学习
复制docker的方法

Docker容器迁移可通过两个步骤完成:1)使用docker commit命令将原容器保存为新镜像,需指定原容器ID/名称和目标镜像名;2)通过docker run从新镜像启动容器,支持添加交互式(-it)、命名(--name)等参数。该方法保留了原容器文件系统状态,实现快速容器复制迁移。

#docker#容器#linux
《VLA 系列》MemoryVLA++ | 感知-认知记忆 | 潜空间未来想象 | 论文与源码边界解析

单帧 VLA 容易遇到两类时间问题:它既不知道当前画面之前发生了什么,也无法判断正在运动的场景接下来会怎样变化。按钮按下前后几乎一样,需要过去记忆;传送带上的物体仍在移动,需要对未来位置做预判。MemoryVLA++ 的核心思路是把时间建模拆成过去、现在、未来三部分:当前观测形成工作记忆,感知-认知记忆库保存并检索历史,视频世界模型在潜空间提取未来动态,最后由扩散动作专家统一生成连续动作。:Mem

文章图片
#人工智能
《VLA 系列》MemoryVLA | 感知-认知记忆库 | 长时序操作 | 论文与源码解析

机器人操作并不总是一个只看当前画面就能决策的 Markov 问题。按钮按下前后几乎没有视觉差异,物体被杯子遮住后当前位置不再可见,清理物体并计数还要求机器人记住已经完成了多少步。MemoryVLA 的核心判断是:VLA 不应把所有历史帧粗暴拼进视觉语言模型,而应维护一个可检索、可压缩、同时保留视觉细节与语义摘要的长期记忆。图 1 的按钮任务给出了最直接的矛盾:当前帧只能告诉模型按钮现在在哪里,却不

文章图片
#人工智能
PyTorch中的torch.cuda.amp.autocast

本文介绍了pytorch中的torch.cuda.amp.autocast

#人工智能#计算机视觉#pytorch
《VLA 系列》GR00T N1 | 双系统 VLA | 数据金字塔 | N1.5/N1.6/N1.7 源码演进

机器人基础模型面临的核心矛盾不是模型不够大,而是数据被切成了许多互不连通的岛:单一机器人轨迹精确但昂贵,人类视频量大却没有机器人动作,仿真便宜却有域差异,互联网图文擅长语义却缺少控制信号。GR00T N1 的回答是同时改造数据和模型:用数据金字塔汇集四类监督,再用慢速视觉语言系统理解任务、快速扩散系统生成连续动作。本文首先解读 2025 年论文中的 GR00T N1,随后单独分析官方 Isaac-

#人工智能
    共 77 条
  • 1
  • 2
  • 3
  • 8
  • 请选择