
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
一. 产生背景 深度学习的发展带动了一批深度学习框架,caffe、tensorflow、pytorch等,对于计算量庞大的CNN,效率一直是大家所关注的,接触过深度网络压缩的同学应该知道网络压缩最关键的两个思路,剪枝和量化。 TensorRT就是量化,将FP32位权值数据优化为 FP16 或者 INT8,而推理精度不发生明显的降低。 关于TensorRT首先要
立体视觉 是通过图像间的对应关系,根据三角测量原理,得到视差图,主要过程包括:摄像机标定、立体标定、立体校正、计算视差图。 在得到视差信息后,很容易根据投影模型 计算原始图像的深度,立体匹配技术被 认为是立体视觉中最困难也是最关键的问题,容易受 光照、噪声、非显著纹理(特征)等问题影响,无法得到较好的匹配效果。 本节主要讲解 OpenCV 自带立体视觉模块 Ster
车辆是视频场景中最关键的对象之一,车辆 和 人 是视频检测永恒的话题。 车辆检测 是车辆分析中关键的一步,是后续进行 车型识别、车标识别、车牌识别、车辆特征 的基础。 关于检测的方法和框架有很多,不外乎是特征训练和分类,这里推荐两篇综述性文章:[1] Benenson R, Omran M, Hosang J, et al.Ten Years of Pe
最近在试着用Three.js做一个简单的赛车游戏,里面有一个需要解决的问题是如何判断两个物体发生了碰撞,比如赛车是否碰上了障碍物或者获得了奖励物品。示例我找了一些资料,发现了两个示例程序:第一个示例、 第二个示例 。 以上两个程序都是用 THREE.Raycaster 类来解决问题的。 Raycaster类Raycaster 应该翻译为“光线投射”,顾名
关于 傅里叶变换,讲的太多了,这里我就不再啰嗦一遍了,原理的东西大家可以搜一下,推荐一篇文章: 如果看了此文你还不懂傅里叶变换,那就过来掐死我吧 这篇文章写得很不错了,从 频域 到傅里叶级数 讲的都比较细,而且都有配图,真看不懂的话就 你掐死他吧! (PS:冤冤相报何时了,我在一旁看热闹,横批:不嫌事大) 看下效果(居然暴漏了
一. 人工智能应用领域1. 计算机视觉 生物特征识别:人脸识别、步态识别、行人ReID、瞳孔识别; 图像处理:分类标注、以图搜图、场景分割、车辆车牌、OCR、AR; 视频分析:安防监控、智慧城市;2. 自然语言处理 语音识别(Siri、Cortana、讯飞)、文本数据挖掘、文本翻译;3. 数据挖掘 消费习惯、天气数据、推荐系统、知识库(专家系统);4. 游戏 角
1. VQA Visual Question Answering,给出一张图片,就该图片提出任何问题?自动get到你所期望的答案。这属于Visual Reasoning 的范畴,学者们不满足于传统的图像识别、分割、Caption等工作,尝试去挖掘更高级的机器推理能力。来看解决思路,CNN、LSTM(RNN)、Attention Model、BOW,都是图像、文本、NLP领域的通用手法,
一. 提出背景 目标检测在图像处理领域有着非常大的占比,过去两年,深度学习在Detection的持续发力,为这个领域带来了变革式的发展:一方面,从 RCNN 到 Fast RCNN,再到 Faster RCNN,不断刷新 mAP;另一方面,SSD、YOLO 则是将性能提高到一个非常高的帧率。 对于视频来讲,相邻帧目标之间存在 明显的上下文关系,这种关系在技术上的表现就是 T
一. 人工智能应用领域1. 计算机视觉 生物特征识别:人脸识别、步态识别、行人ReID、瞳孔识别; 图像处理:分类标注、以图搜图、场景分割、车辆车牌、OCR、AR; 视频分析:安防监控、智慧城市;2. 自然语言处理 语音识别(Siri、Cortana、讯飞)、文本数据挖掘、文本翻译;3. 数据挖掘 消费习惯、天气数据、推荐系统、知识库(专家系统);4. 游戏 角
1. VQA Visual Question Answering,给出一张图片,就该图片提出任何问题?自动get到你所期望的答案。这属于Visual Reasoning 的范畴,学者们不满足于传统的图像识别、分割、Caption等工作,尝试去挖掘更高级的机器推理能力。来看解决思路,CNN、LSTM(RNN)、Attention Model、BOW,都是图像、文本、NLP领域的通用手法,







