登录社区云,与社区用户共同成长
邀请您加入社区
前几天在 192.168.31.9 这台 H100 双卡的机器上配 Cline,想用本地的 Qwen3-VL-32B 做代码开发。本以为是个"装个 Ollama 跑模型"的简单活,结果一上手就踩了 6 个坑——Ollama 一直 OOM 加载失败、显存碎片化、split mode 自动跨卡、端口混乱、Model ID 猜不对、容器内外不互通。最后靠换vLLM 的 OpenAI 兼容 API才彻底解
将答题卡区域拉正为矩形,转为灰度图,然后使用 OTSU 自动阈值二值化,并反转(BINARY_INV),使选项涂黑区域变为白色(方便统计白色像素),背景为黑色。检测所有外层轮廓,绘制出来,同时按面积从大到小排序,遍历轮廓,用多边形近似,找到第一个近似为四边形(4 个顶点)的轮廓,即为答题卡外框。遍历每 5 个轮廓(即一道题),对这 5 个轮廓按从左到右排序,对每个选项创建掩码,与二值图做按位与,统
本文记录一个专用时间戳 OCR 训练工作流:用 OpenCV 从视频帧中定位黄色时间戳 ROI,借助 PaddleOCR 过滤候选区域,生成 labels.csv,再训练 CRNN + CTC 模型并导出 ONNX,适合固定格式、固定字符集的业务 OCR 场景。
平台延迟FPS功耗适用场景RK3588 NPU12ms835W低功耗边缘5.2ms19215W高性能边缘RTX 40901.5ms667450W服务器。
单目相机本身只能获取二维图像,无法直接得到真实深度信息。如果想用单个相机做三维重建,常见做法是引入主动光源,比如投影仪投射条纹图案。结构光三维重建其中,投影仪投射编码条纹,单目相机采集物体表面的条纹变形图像。通过分析条纹相位变化,再结合相机和投影仪的标定参数,就可以恢复物体表面的三维坐标。单目相机标定条纹图生成条纹图采集相位计算相位展开投影仪坐标恢复三维点云重建Python 和 C++ 核心代码本
色块识别是机器视觉中最简单也最常用的算法,核心逻辑是。整个过程就像 "先按颜色挑出所有目标像素,再把连在一起的像素拼成一个个色块轮廓,最后选出符合要求的那个"。
本文介绍了使用Triton Inference Server部署YOLOv26模型的两种方案,重点推荐基于ensemble后端的集成部署方式。传统方案将预处理/后处理与推理分离,存在带宽占用高、延迟长的问题。而ensemble方案通过Python后端将预处理、模型推理和后处理整合到同一个Triton服务中,形成完整流水线:客户端发送编码图像→Triton统一处理→返回检测结果。
基于 MATLAB 的图像增强技术实现
本文介绍了OpenCV在Python环境下的三个核心图像处理技术:1. 图像金字塔:包括高斯金字塔(下采样缩小/上采样放大)和拉普拉斯金字塔(保存细节信息),演示了512×512图像的多级缩放与细节还原。2. 图像直方图:实现灰度直方图、彩色三通道直方图和掩膜局部直方图,用于分析图像明暗分布和色调特征。3. 直方图均衡化:对比全局均衡化和CLAHE自适应均衡化效果,后者通过分块处理能更好保留细节。
本文从神经风格迁移的原理出发,深入浅出地讲解了如何利用OpenCV DNN 模块轻松实现静态图像和实时摄像头的风格迁移。全部代码不超过 30 行,却展现了人工智能与艺术的奇妙结合。无论你是计算机视觉的初学者,还是想快速开发一个创意应用,这都是一份极佳的参考。未来,随着等轻量级网络的出现,风格迁移将变得更加高效,甚至可以运行在微型设备上。而结合GAN的CycleGANAnimeGAN等技术,更是让实
OpenCV 新手入门与实战部署指南
本文介绍了面向光滑物体的双相机 + 格雷码 + 多频相移结构光三维重建方案。双相机标定和立体校正投影格雷码图案和多频相移条纹左右相机同步采集图像使用格雷码确定条纹周期编号使用多频相移计算高精度绝对相位根据编码和相位进行左右匹配得到视差图并通过Q矩阵恢复三维点云格雷码解决稳定性多频相移解决精度双相机解决三维几何调制度和曝光控制解决光滑表面噪声对于光滑、低纹理物体,普通双目视觉往往难以稳定匹配,而主动
日常拍摄发票、证件、纸质文档时,难免出现倾斜、透视畸变、角度偏移问题,直接影响 OCR 文字识别、特征提取效果。传统裁剪、旋转无法解决近大远小的透视变形问题。本文基于 OpenCV + Numpy 实现一套通用文档透视矫正完整流水线: 图像缩放预处理 → 轮廓检测 → 最大票据轮廓筛选 → 四边形拟合 → 四点透视变换转正 → 灰度二值化 → 腐蚀去噪 → 角度矫正代码通用性极强,可适配发票、身份
本文介绍了双目相机 + 多频相移结构光三维重建的基本流程。对双目相机进行标定和立体校正投影多组不同频率的正弦条纹图左右相机同步采集条纹图使用四步相移法计算包裹相位使用多频方法展开高频相位通过左右相位匹配得到视差图结合双目标定得到的Q矩阵恢复三维点云双目结构光的核心思想是:用结构光解决匹配问题,用双目几何解决三维重建问题。相比普通双目视觉,它对低纹理物体更加友好;相比单目结构光,它又可以利用双目系统
本文介绍了NS航司验证码破解的技术方案,主要针对六种随机下发的滑动验证码类型(Silder/CURVE2/CURVE/WORD/MOBIE/Silder2)。方案包含三个关键环节:1) 通过接口分析获取验证码背景图;2) 采用图像处理技术(灰度化、降噪、边缘检测等)定位缺口位置;3) 模拟人类滑动轨迹(变速移动+随机抖动)。该方案通过结合缺口检测(60%)和局部方差分析(40%)的投票机制,识别准
在普通双目视觉中,三维重建的核心问题是左右图像匹配。如果物体表面纹理丰富,双目匹配相对容易;但如果物体表面是白色、光滑、低纹理区域,传统匹配就很容易失败。为了解决这个问题,可以引入结构光投影。双目相机 + 格雷码条纹它的核心思想是:投影仪向物体表面投射格雷码条纹,让物体表面带有主动编码;左右相机分别采集这些编码图案,再根据编码结果建立左右像素匹配,最后使用双目三角测量恢复三维点云。双目相机标定格雷
本文档记录了在NVIDIA Jetson平台上解决cv2.VideoWriter无法调用NVENC硬件加速的问题。问题表现为:root用户下可使用软件编码,普通用户则崩溃。通过分析发现三个主要问题:1)系统缺少V4L2节点导致硬件加速失败;2)普通用户误装标准OpenCV库,缺少硬件支持;3)root用户创建的文件导致权限冲突。最终解决方案包括:卸载冲突的OpenCV库、清理root文件、配置正确
【代码】OpenCV入门。
在数字图像处理中,直方图是描述图像像素灰度分布最基础的工具,结合图像金字塔、掩膜、直方图均衡化,可以实现图像分层分解、局部像素统计、暗光图像增强等经典功能。本文整合全套实战代码,包含:图像金字塔(高斯 / 拉普拉斯)、灰度直方图、彩色直方图、掩膜局部直方图、全局直方图均衡、自适应 CLAHE 均衡,逐段讲解原理与代码,适合 OpenCV 图像处理入门学习。目录文章前言一、图像金字塔:高斯金字塔 +
基于OpenCV 5 DNN的轻量化OCR系统设计与实现 摘要 本研究设计并实现了一种仅依赖OpenCV 5 DNN模块的轻量化OCR系统,解决了传统OCR方案依赖框架臃肿、部署复杂的问题。系统支持PP-OCRv3至v6全系列模型,覆盖50余种语言识别,通过OpenCV DNN实现端到端推理。关键技术包括:优化DBNet检测模型适配、实现CRNN识别网络解码、解决OpenCV 5版本兼容性问题。实
设AAA为二值图像中的像素集合,BBB为结构元素。腐蚀A⊖Bz∣Bz⊆AA⊖Bz∣Bz⊆A// 结构元素完全包含在A中的所有中心点膨胀A⊕Bz∣Bz∩A≠∅A⊕Bz∣Bz∩A∅// 结构元素(取反射后)在A中有交集的所有中心点开运算A∘BA⊖B⊕BA∘BA⊖B⊕B// 先腐蚀后膨胀:去除小凸起、断开细连接闭运算A∙BA⊕B⊖BA∙BA⊕B⊖B。
步骤工具关键参数校准数据200+ 张代表性图片覆盖全场景PTQ 量化精度校验余弦相似度 > 0.99逐层对比性能测试trtexec延迟/FPS/功耗。
优化效果代价FP162x 加速几乎无损INT84x 加速1-2 mAP降分辨率2-4x 加速3-8 mAP关键点裁剪小模型需重训。
PyTorch使用教程-PyTorch数据读取前言PyTorch作为一款深度学习框架,已经帮助我们实现了很多很多的功能了,包括数据的读取和转换了,那么这一章节就介绍一下PyTorch内置的数据读取模块吧模块介绍pandas 用于方便操作含有字符串的表文件,如csvzipfile python内置的文件解压包cv2 用于图片处理的模块,读入的图片模块为BGR,N H W Ctorchvision.t
本文主要探讨了在预训练模型瓶颈显现的背景下,后训练和推理计算的重要性,并建议从模型服务(serving)入手,因为这是模型应用的第一步。文章比较了SGLang和vLLM两个框架,它们分别来自斯坦福和UC伯克利,功能相似,但各有特色。SGLang提供了丰富的服务功能,如chunkedprefill、speculativedecoding、radixattention和structured
OPENCV调用PYTORCH的.pth,转onnx,会出现一些差异,cv2.dnn.blobFromImage(image,scalefactor=1.0,size,mean,swapRB=True,crop=False,ddepth=CV_32F)1,转换RGB,因为PIL是RGB格式,而OPENCV是BGR2,需要归一化,scalefactor=1.0/2553,最好图片不要进行缩放,因为P