登录社区云,与社区用户共同成长
邀请您加入社区
前几天在 192.168.31.9 这台 H100 双卡的机器上配 Cline,想用本地的 Qwen3-VL-32B 做代码开发。本以为是个"装个 Ollama 跑模型"的简单活,结果一上手就踩了 6 个坑——Ollama 一直 OOM 加载失败、显存碎片化、split mode 自动跨卡、端口混乱、Model ID 猜不对、容器内外不互通。最后靠换vLLM 的 OpenAI 兼容 API才彻底解
文章摘要 本文介绍了抑制伪彩色(False Color Suppression, FCS)算法的原理与实现。FCS通过检测图像边缘区域(edgemap)动态调整色度(UV)的饱和度,在平坦区域保留色彩,在强边缘区域降低色度增益以减少伪彩色条纹。算法采用分段处理:边缘值低于阈值时保持原色度,超过最大阈值时完全去色,中间过渡区线性衰减。实现中关键参数包括边缘阈值、增益系数等,并通过Python代码展示
步骤工具输出导出 ONNX.onnx转 TensorRT.engine推理关键点可视化draw_pose骨架图。
平台转换工具推理延迟功耗适用场景JetsonTensorRT3.2ms15W高性能RK3588RKNN8ms5W通用GK7206GMT15ms2W低功耗。
学习笔记 | 更新: 2026-06-05。
将答题卡区域拉正为矩形,转为灰度图,然后使用 OTSU 自动阈值二值化,并反转(BINARY_INV),使选项涂黑区域变为白色(方便统计白色像素),背景为黑色。检测所有外层轮廓,绘制出来,同时按面积从大到小排序,遍历轮廓,用多边形近似,找到第一个近似为四边形(4 个顶点)的轮廓,即为答题卡外框。遍历每 5 个轮廓(即一道题),对这 5 个轮廓按从左到右排序,对每个选项创建掩码,与二值图做按位与,统
本文记录一个专用时间戳 OCR 训练工作流:用 OpenCV 从视频帧中定位黄色时间戳 ROI,借助 PaddleOCR 过滤候选区域,生成 labels.csv,再训练 CRNN + CTC 模型并导出 ONNX,适合固定格式、固定字符集的业务 OCR 场景。
继续。下面进入。
平台延迟FPS功耗适用场景RK3588 NPU12ms835W低功耗边缘5.2ms19215W高性能边缘RTX 40901.5ms667450W服务器。
色块识别是机器视觉中最简单也最常用的算法,核心逻辑是。整个过程就像 "先按颜色挑出所有目标像素,再把连在一起的像素拼成一个个色块轮廓,最后选出符合要求的那个"。
这篇文章深入浅出地讲解了图像数字化处理的核心概念,重点剖析了模型如何"看到"图像数据。主要内容包括: 模型视角:模型看到的是排列好的数字而非视觉图像 图像处理链路:图片→像素→通道→张量→网络输入 关键概念解析:像素、通道、张量、shape、batch和归一化 张量格式转换:HWC、CHW、BCHW的区别与应用场景 工具差异:OpenCV、PIL、PyTorch处理图像的不同特点 预处理要点:归一
专门针对HDR(高动态范围)图像设计,兼容浮点型数据、保留完整动态范围,避免普通滤波算法对HDR的数值截断问题。同时提供可视化对比和工业级优化建议,适配影视后期、计算摄影、高动态场景去噪等需求。
本文分享了破解文字点选验证码的经验:1)通过captcha_id生成乱序映射数组还原图片顺序,注意列映射方向;2)重点解决了加密参数ac长度不足的问题,从153字节补到900多字节才能通过严格站点验证。文章提供了拼图代码和关键思路,提醒开发者注意这两个易错点。最终验证通过证明参数长度和完整性对验证码破解至关重要。
本文介绍了使用EfficientViT-B1模型进行Cityscapes图像分割的完整流程。主要内容包括:1. 模型准备:下载官方预训练权重,进行PyTorch推理测试;2. 模型转换:将PyTorch模型导出为ONNX格式,解决版本兼容性问题导致输出异常的问题;3. 模型部署:通过交叉编译将ONNX模型转换为NPU可运行的NB格式;4. 后处理实现:详细说明了模型输出的解析和可视化方法;5. 板
本文介绍了使用Triton Inference Server部署YOLOv26模型的两种方案,重点推荐基于ensemble后端的集成部署方式。传统方案将预处理/后处理与推理分离,存在带宽占用高、延迟长的问题。而ensemble方案通过Python后端将预处理、模型推理和后处理整合到同一个Triton服务中,形成完整流水线:客户端发送编码图像→Triton统一处理→返回检测结果。
字体文件fzlth.ttf必须放在程序同级目录,否则字体打开失败;SDL 1.2 无 Alpha 通道、无新版格式接口,只能手动构造;pitch行跨度是水印花屏的核心根源,必须逐行拷贝;RK OSD 位图强制16 字节对齐,对齐函数不可省略;所有、SDL 资源、媒体 Buffer 都必须手动释放。问题:水印区域出现彩色噪点 / 花屏原因:宽高、坐标未做 16 对齐;结构体未memset清零产生脏数
基于 MATLAB 的图像增强技术实现
本文介绍了OpenCV在Python环境下的三个核心图像处理技术:1. 图像金字塔:包括高斯金字塔(下采样缩小/上采样放大)和拉普拉斯金字塔(保存细节信息),演示了512×512图像的多级缩放与细节还原。2. 图像直方图:实现灰度直方图、彩色三通道直方图和掩膜局部直方图,用于分析图像明暗分布和色调特征。3. 直方图均衡化:对比全局均衡化和CLAHE自适应均衡化效果,后者通过分块处理能更好保留细节。
柑橘果实病害目标检测数据集2026优化版 图像分类 深度学习 python编程
本文从神经风格迁移的原理出发,深入浅出地讲解了如何利用OpenCV DNN 模块轻松实现静态图像和实时摄像头的风格迁移。全部代码不超过 30 行,却展现了人工智能与艺术的奇妙结合。无论你是计算机视觉的初学者,还是想快速开发一个创意应用,这都是一份极佳的参考。未来,随着等轻量级网络的出现,风格迁移将变得更加高效,甚至可以运行在微型设备上。而结合GAN的CycleGANAnimeGAN等技术,更是让实
OpenCV 新手入门与实战部署指南
本文介绍了RGB到YUV色彩空间转换的原理和Python实现,重点使用BT.601标准公式。YUV色彩空间中Y代表亮度,U/V表示色度。文章给出了转换矩阵公式,并通过NumPy实现了高效向量化计算,包含防溢出处理(使用uint32中间类型)和结果规范化(除以1024)。测试验证了纯灰图像的色度中性(Cb/Cr≈128)和白点亮度值(Y≈217),证实了算法的正确性。该转换可用于图像处理中的亮度和色
摘要 本期专栏聚焦农业遥感AI技术,针对耕地与作物识别的行业痛点,提出双分支网络解决方案。方案通过地块分割与作物分类双任务协同,融合时序、纹理、光谱特征,有效解决裸地与耕地混淆、地块粘连、作物错分等核心难题。关键技术包括边界感知U-Net优化、干扰剔除模块和批量后处理,支持耕地精准提取、非农干扰自动剔除、多作物分类及批量制图。代码提供完整模型架构与干扰净化实现,可适配全国不同地貌的耕地监测需求,满
本文介绍了面向光滑物体的双相机 + 格雷码 + 多频相移结构光三维重建方案。双相机标定和立体校正投影格雷码图案和多频相移条纹左右相机同步采集图像使用格雷码确定条纹周期编号使用多频相移计算高精度绝对相位根据编码和相位进行左右匹配得到视差图并通过Q矩阵恢复三维点云格雷码解决稳定性多频相移解决精度双相机解决三维几何调制度和曝光控制解决光滑表面噪声对于光滑、低纹理物体,普通双目视觉往往难以稳定匹配,而主动
关键点索引与连接关系:│ 索引 │ 名称 │ 连接关系 ││ 0 │ 鼻子 │ → 左眼(1), 右眼(2) ││ 1 │ 左眼 │ → 鼻子(0), 左耳(3) ││ 2 │ 右眼 │ → 鼻子(0), 右耳(4) ││ 3 │ 左耳 │ → 左眼(1) ││ 4 │ 右耳 │ → 右眼(2) ││ 5 │ 左肩 │ → 右肩(6), 左肘(7) ││ 6 │ 右肩 │ → 左肩(5), 右肘(
日常拍摄发票、证件、纸质文档时,难免出现倾斜、透视畸变、角度偏移问题,直接影响 OCR 文字识别、特征提取效果。传统裁剪、旋转无法解决近大远小的透视变形问题。本文基于 OpenCV + Numpy 实现一套通用文档透视矫正完整流水线: 图像缩放预处理 → 轮廓检测 → 最大票据轮廓筛选 → 四边形拟合 → 四点透视变换转正 → 灰度二值化 → 腐蚀去噪 → 角度矫正代码通用性极强,可适配发票、身份
本文介绍了双目相机 + 多频相移结构光三维重建的基本流程。对双目相机进行标定和立体校正投影多组不同频率的正弦条纹图左右相机同步采集条纹图使用四步相移法计算包裹相位使用多频方法展开高频相位通过左右相位匹配得到视差图结合双目标定得到的Q矩阵恢复三维点云双目结构光的核心思想是:用结构光解决匹配问题,用双目几何解决三维重建问题。相比普通双目视觉,它对低纹理物体更加友好;相比单目结构光,它又可以利用双目系统
本文档记录了在NVIDIA Jetson平台上解决cv2.VideoWriter无法调用NVENC硬件加速的问题。问题表现为:root用户下可使用软件编码,普通用户则崩溃。通过分析发现三个主要问题:1)系统缺少V4L2节点导致硬件加速失败;2)普通用户误装标准OpenCV库,缺少硬件支持;3)root用户创建的文件导致权限冲突。最终解决方案包括:卸载冲突的OpenCV库、清理root文件、配置正确
【代码】OpenCV入门。
*视觉语言模型(Vision Language Model, VLM)**是一类能够同时处理视觉信息(图像、视频)和文本信息,并在两种模态之间建立深度语义关联的人工智能模型。核心本质:VLM通过在共享的语义嵌入空间中对齐视觉特征和语言表示,实现"看图说话"、"听文生图"的跨模态理解与生成能力。理解图像内容并用自然语言描述遵循涉及视觉的复杂文本指令推理跨越视觉和语言的多模态信息泛化到训练时从未见过的
在数字图像处理中,直方图是描述图像像素灰度分布最基础的工具,结合图像金字塔、掩膜、直方图均衡化,可以实现图像分层分解、局部像素统计、暗光图像增强等经典功能。本文整合全套实战代码,包含:图像金字塔(高斯 / 拉普拉斯)、灰度直方图、彩色直方图、掩膜局部直方图、全局直方图均衡、自适应 CLAHE 均衡,逐段讲解原理与代码,适合 OpenCV 图像处理入门学习。目录文章前言一、图像金字塔:高斯金字塔 +
摘要: 本文提出一种基于DNA算法的遥感图像加解密技术,结合生物DNA碱基编码规则与混沌系统,实现高安全性图像加密。算法将像素数据转换为DNA四碱基序列(A/T/C/G),通过模4代数运算(加、减、异或)和Arnold置乱完成像素混淆与扩散,并利用Logistic混沌映射动态生成随机密钥,显著提升密钥空间。测试基于MATLAB 2024B,核心程序包括DNA编码/解码、混沌序列生成及像素置乱模块,
基于YOLO26的晶圆缺陷检测系统,阐述了整个数据制作和训练可视化过程