logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从 2D 图像中学习 3D 人机交互关系

LEMON(LEarning 3D huMan-Object iNteraction relation)模型是一个统一的框架,它通过联合预测人类接触点、物体可供性和人-物空间关系这三个交互元素,来捕捉人类与物体在3D空间中的交互关系。LEMON模型的核心思路是利用交互中人和物体的语义与几何上的关联去建模这些交互表征。

文章图片
#学习#3d#人机交互
又一个很牛的数字人,可以让憨豆讲普通话

JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation》提出了一种基于扩散模型的音频驱动面部动画生成方法,通过解耦的面部表示框架和扩散变换器实现了面部动态和头部运动的生成。该方法不仅适用于人类肖像动画,还能够生成

基于当前最前沿的前端(Vue3 + Vite + Antdv)和后台(Spring boot)实现的低代码开发平台

项目名称:lowcode-seezoon,可以暂称其为“基于Vue3+Vite+Antdv+Spring Boot的低代码开发平台”。项目目标:以快速开发为目的,提供一套高效、灵活的低代码开发解决方案。技术栈前端后台。

文章图片
#前端#spring boot#低代码
车牌检测、车牌四角定位、车牌矫正对齐程序

U2FsdGVkX1+63lVl9iZ8Y+qE7AqKqMVO+F2hC5rqU5eWFTHkPYqOwg1sdjT6M/vO rDBKVOZwX7p7sjq2lR+VBq4obZKyVfJJ6K/CiqB5vTw=

#深度学习
无人机目标识别跟踪

无人机目标识别跟踪

#深度学习
实战threeJS数字孪生开源 数字工厂

该项目结合了现代前端技术栈,包括Vue 3、Element Plus、Three.js和ECharts等,实现了路线巡逻、巡逻轨迹展示、第一人称视角、视角切换、着色器渲染、设备定位、区域检测以及进入区域告警提示等核心功能。它结合了现代前端技术栈,实现了路线巡逻、巡逻轨迹展示、第一人称视角、视角切换、着色器渲染、设备定位、区域检测以及进入区域告警提示等核心功能。:作为数据可视化库,ECharts 提

文章图片
人脸识别项目介绍

项目介绍人脸识别从Python或命令行中识别和操作面部世界上最简单的人脸识别库。使用dlib的最新人脸识别功能构建建立在深度学习之上。该模型的精度为99.38%。Wild 基准中的标记面孔。这也提供了一个简单的face_recognition命令行工具,您可以通过命令行在图像文件夹上进行人脸识别!特征在图片中查找面孔查找出现在图片中的所有面孔:import face_recognitionimag

#深度学习#神经网络#tensorflow +1
OpenVLA 技术综述

OpenVLA是由斯坦福大学等机构提出的开源通用机器人控制模型(2024),通过结合视觉语言模型与动作预测,实现自然语言指令到机器人动作的端到端控制。其核心采用7B参数的LLaMA-2语言模型,创新性包括:动作离散化复用词表、双路视觉编码(SigLIP+DINOv2)、基于OpenX-Embodiment数据集的预训练(97万轨迹/29种机器人)。实验显示在LIBERO空间任务上达到80%成功率,

#人工智能#机器人
图片校正软件 操作说明及算法介绍

摘要:本文介绍了一款基于OpenCV和深度学习的双区域图片校正工具。该软件能自动定位图片左右区域各4个特征点,通过透视变换将倾斜区域校正为规则矩形,并自动拼接保存结果。支持Ubuntu/Windows系统,提供深度学习自动定位和手动调整两种模式,配套轻量化MobileNet模型确保定位精度。核心算法包含特征点检测和四点透视校正两部分,具有处理速度快(1-2秒/图)、精度高、操作简便等特点,适用于文

文章图片
#算法
    共 26 条
  • 1
  • 2
  • 3
  • 请选择