logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

python遇坑总结

原因:u_int16_t 和 u_int32_t 是 Linux/Unix 系统中常用的类型定义,但在 Windows 系统中通常不支持。解决方案:替换所有的 u_int16_t 和 u_int32_t 为标准的 uint16_t 和 uint32_t。解决方案:python setup.py build_ext --inplace -j1。原因:这样可以取消并行编译,更容易获得报错信息。

文章图片
#python#开发语言
[PRL2015]The MAHNOB Mimicry Database: A database of naturalistic human interactions

目标为了学习人的社会行为而创建了一个一对一交流数据库(MAHNOB Mimicry Database)数据库信息模态:视频+声音+身体追踪标签互动组数:54组(34组是关于政治话题的讨论,20组是关于租赁协议的讨论)总共时长:11小时参与人数:12个同盟者+48个对手标签:54组中的15组有完全的面部和身体追踪标签分类:模仿者和非模仿者重点模仿行为的存在与否可以作为自闭症的指...

#人工智能#机器学习#大数据 +2
相机参数转换随笔

首先需要确定当前外参是w2c还是c2w,一般数据集中提供的都是w2c矩阵,因为这个矩阵是用于将世界坐标系的网格投影到相机坐标系中。确定好了是w2c之后,由于opencv和opengl的y轴和z轴的方向是相反的,因此只需要将对应坐标轴反过来即可。

#计算机视觉#人工智能#深度学习
常用3D表示

目前 3D 学习中,物体或场景的表示包括显式表示与隐式表示两种,主流的显式表示包括基于 voxel、基于 point cloud、和基于 polygon mesh 三种,隐式表示包括基于 Occupancy Function [1]、和基于 Signed Distance Functions [2] 两种。下表简要总结了各种表示方法的原理及其相应优缺点。1.1 Voxel表示图像:表示原理:体素用

#计算机视觉
[SIGGRAPH2023-best]3D Gaussian Splatting for Real-Time Radiance Field Rendering

本文提出了一种基于3D高斯体进行场景重建的方案,并提供了高效的渲染器实现。其重建精度,训练速度和推理速度均超越之前的SOTA方案。整体的思路就是先使用传统方案(COLMAP)将多视角图像对齐,并提取稀疏点云。然后以这些点为基础构建高斯体,在训练中动态的增减高斯体的数量和半径。之后对高斯体进行渲染,获得最终的重建结果。

#人工智能#计算机视觉
self-attention中的QKV机制

之前有写过attention和transformer的理解,但是对于self attention中的qkv一直理解的不够透彻,直到今天看了李宏毅的视频才理解,所以记录一下。所谓QKV也就是Q(Query),K(Key),V(Value)首先回顾一下self-attention做的是什么:所谓自注意力,也就是说我们有一个序列X,然后我们想要算出X对X自己的注意力,也即X中的每个时间点与其余时...

#java#python#人工智能 +2
到底了