登录社区云,与社区用户共同成长
邀请您加入社区
26年8月来自Star VLA的论文“Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models”。核心定位:提出VLAct,一套面向视觉‑语言‑动作(VLA)模型的以表征为中心的持续预训练范式。不追求无限扩大机器人轨迹数据规模,而是在固定机器人数据预算下,
26年7月来自香港大学 AI MMLab、加州大学伯克利分校、清华大学、北京大学、斯坦福大学、麻省理工学院和上海交通大学等的论文“RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies”。针对通用机器人操纵策略(Generali
技术架构(零售物理操作系统+自主导航+精准取货);运营模型(15秒交付+99%稳定运营+单店盈利跑通);场景复制(赛事市集+商业综合体+文旅景区)。具身智能零售将“购买”升级为“互动体验”,引流率和转化率显著高于传统设备。以智购科技为例,其自动售货机产品持续探索具身智能交互技术的融合应用。产品已出口至全球100多个国家和地区,售后网络覆盖国内外600多个城市、30000多个网点。本文基于行业公开信
GoPro等第二层设备不仅输出RGB图像,还可集成IMU与深度传感器(如RGB-D),提供运动与三维信息。虽相机仅捕获彩色视频,但结合IMU可实现视觉惯性SLAM,提升定位精度。深度数据可直接反映空间结构,但存在误差;无深度时则需依赖多视角或模型估算几何。因此,设备采集仅是起点,后续如何融合数据、构建地图及估计轨迹,才是关键。
我们提出了 360CityArena,这是一个用于评估具身智能体在由 360° 视频构建的逼真环境中的城市探索能力的基准。现有的室外基准要么缺乏足够的逼真度,要么缺乏复杂性,导致与真实的城市环境存在巨大差距。360CityArena 建立在日本东京秋叶原地区的逼真重建之上,使用了 602 个 360° 视频片段,覆盖 85 条街道,并包含 175 个精心人工设计的任务。
本推文介绍ThinkDeeper:一个面向自动驾驶视觉定位的世界模型框架。该方法以深度线索增强空间感知,通过SA-WM预演未来潜状态,再借助跨模态超图完成目标定位;论文同时提出DrivePilot数据集,并在多个真实道路和通用视觉定位基准上报告了领先表现。
红外热成像人员检测数据集 |红外检测 白热模式 人员检测 夜间监控 目标检测 YOLO格式 深度学习数据集 计算机视觉9067期数据集概述本数据集专注于白热模式红外热成像中的人员目标检测,服务于夜间安防、自动驾驶及应急救援。数据以白热化灰度风格呈现,适配低光照与无光环境下的人员识别与定位应用。数据集核心信息数据要素详细说明类别共 1 类:人员(标注中可能存在重复类别名称,建议合并)数量2900 张
早鸟投稿截止时间:2026年09月27日,CVISPR2026计算机视觉、模式识别与智能系统国际会议,会议已经上线IEEE官方会议列表,珠海科技学院主办;覆盖计算机视觉、模式识别、机器学习、智能感知四大方向,投稿7个工作日反馈审稿。12月4‑6日珠海线上线下混合举办,录用论文IEEE出版,支持EI Compendex、Scopus检索,视觉方向成果抓紧早鸟窗口期投稿。
获取《PyTorch计算机视觉与深度学习》全套PPT课件2026::https://download.csdn.net/download/m0_54748666/93356453。第09章基于生成式对抗网络的图像生成应用.pptx。第07章基于视觉大数据检索的图搜图应用.pptx。第12章污损遮挡号牌识别与违法行为检测.pptx。第04章 PyTorch的基本应用.pptx。第03章卷积神经网络的
计算机视觉在体育分析领域的应用日益深入,目标检测与轨迹跟踪是其中的核心技术。通过帧差法、透视变换等图像处理原理,可以将比赛视频中的运动目标提取为可量化的轨迹数据,进而转化为落点分布、线路偏好等战术指标。这类技术广泛应用于赛事复盘、运动员训练辅助和对手特征分析等场景,帮助教练团队从主观经验判断走向数据驱动的决策。本文以乒乓球比赛视频为例,介绍如何基于Python、OpenCV和深度学习模型构建一套最
投稿有个周期呀!!!time is flying 加油
<think>我们只需要根据给定内容生成≤150字的文章摘要。用户要求“根据以下内容,生成≤150字的文章摘要”,内容是关于驾驶员危险行为目标检测数据集的介绍。我们需要简洁概括。注意不要遗漏核心信息:数据集名称/内容、规模、类别、标注格式、用途。150字以内。注意是中文摘要。 内容标题是“驾驶员危险行为目标检测数据集:3类别、14,000张图像 | 目标检测”,包含三个类别:饮食、使用手机、睡觉。
系统使用 Electron 构建桌面 GUI,以 Flask 提供本机业务与算法服务,将数据集管理、模型训练、模型评估、图片检测、视频检测、实时检测、预警处置和多模态大模型复核整合为一套可追溯的工作流程。正式业务数据均来自真实 YOLO 推理、真实训练/评估任务或已配置的 OpenAI-compatible 模型服务;缺少算法权重或外部服务配置时,界面会明确提示不可用原因,不生成虚假检测框、指标、
YOLO罂粟目标检测数据集:单类违禁植物识别专项资源 | 罂粟检测 YOLO数据集 禁毒巡查 8024期
<think>我们需从原文中提炼关键信息,生成≤150字的摘要。需要涵盖数据集内容、特点、应用等。原文是关于PCB电子元器件目标检测数据集,包含23类约1600张图像,YOLO格式,针对小目标密集、外观相似等挑战,可用于训练深度学习模型。摘要要简洁。</think>本文介绍了一个23类PCB电子元器件目标检测数据集,含约1600张真实工业图像,采用YOLO格式标注,涵盖电阻、电容、芯片等常见元件。
【计算机视觉实践18】基于Swin-UNet模型的医学图像分割.pptx。【计算机视觉实践26】基于CycleGAN模型的图像风格迁移.pptx。【计算机视觉实践17】基于PSPNet模型的人体图像分割.pp女x。【计算机视觉实践12】基于PP-YOLO模型的昆虫检测.pptx。【计算机视觉实践11】基于YOLOV3模型的昆虫检测.pptx。【计算机视觉实践24】基于DCGAN模型的人脸图像生成.
课程第九讲,Jetson上Ultralytics YOLO模型实战,从概念到实时检测,包括YOLO原理、Ultralytics框架、推理流程、实战代码、参数调节,以及连接第八讲视频流。摘要简洁。</think>本课程第九讲介绍在Jetson上使用Ultralytics YOLO模型实现实时目标检测。内容涵盖AI模型原理、YOLO与Ultralytics关系、推理流程、核心代码及参数调整
一套面向胸部 X 光影像教学、科研与辅助分析场景的桌面应用。系统以 Ultralytics YOLO 完成本地目标检测,通过 Electron 提供桌面 GUI,并由 Flask 后端统一管理数据集、模型、训练、评估、图片检测、视频检测、实时影像流、预警、用户和审计记录。在用户主动发起复核时,系统还可以调用 OpenAI-compatible 视觉多模态模型,对 YOLO 检测框及原始影像给出结构
<think>好的,用户要求根据给出的长篇文章生成不超过150字的摘要。原文主要讲损失函数选择,核心结构是:先看任务类型,分类/回归/检测/分割各有不同,然后有三条原则,最后给了可直接套用的起点组合。 摘要需要精炼,抓住重点。原文最核心的框架是“先看任务类型,再看标签长什么样”,这个要体现。四类任务的建议也需要浓缩进去,但受字数限制,不能全部展开,可以概括为一句话:分类用CE、回归用MSE/异常多
第十章-基于卷积神经网络的视觉应用-ver6.pptx。第二章-数字图像生成-ver5-Ying.pptx。第四章-基础图像处理-ver5-Ying-pptx。第七章-聚类与分割-ver6-Ying.pptx。第九章-卷积神经网络基础-ver6.pptx。第一章-计算机视觉概述-ver6.pptx。第五章-特征检测与匹配-ver7.pptx。第八章-立体视觉-v7-Ying.pptx。第六章-识别
无花果目标检测数据集 |无花果检测 智慧农业 果实识别 目标检测 YOLO格式 深度学习数据集 计算机视觉9049期
<think>我们只需要根据用户提供的内容生成一个≤150字的摘要。内容主要是介绍超市空货架目标检测数据集,包括数据规模、格式、结构等。摘要需要简洁概括核心信息。注意字数限制。</think>该数据集包含1,500张超市空货架图像,采用YOLO格式标注单类别“空”,并划分为训练、验证、测试集。数据覆盖多种货架类型、商品及光照条件,专为目标检测模型训练设计,可直接用于YOLOv5/v8等框架,助力零
药品经营许可证识别技术利用AI视觉,通过图像增强、目标检测与OCR、语义纠偏三级流程,将模糊证件快速转为结构化数据,准确提取全字段,无惧拍摄不良与印章遮挡,并支持批量处理。该技术已应用于药企、电商平台、机构等场景,实现
<think>我们根据要求生成不超过150字的摘要。内容是关于路面坑洼与积水目标检测数据集的介绍,包括规模、类别、格式、来源等。摘要需简洁。</think>该数据集包含1500张道路实景图像,标注坑洼与积水两类目标,采用YOLO格式,分为训练、验证、测试集。数据覆盖多种路面、光照和天气条件,可用于基于深度学习的道路病害检测模型训练与优化。
建筑物目标检测数据集 | 建筑物检测 城市规划 遥感解译 目标检测 5012期
垃圾物品检测数据集(Trash Detection Dataset)| 垃圾分类 目标检测 智能回收 环卫管理5008期
三角洲行动目标检测数据集(Delta Force Action Dataset)YOLOv8 游戏AI 敌我识别 深度学习数据集 计算机视觉
垃圾物品目标检测数据集 | 垃圾分类 回收检测 城市环卫 目标检测9012期
本文介绍一个基于 Qwen2.5-VL-7B-Instruct 和 LoRA 的自定义目标检测开源项目。项目支持自定义类别、conversations 格式数据集、断点续训、最佳 checkpoint 选择、IoU 评估、检测结果可视化以及单图推理,并提供 Windows、Linux 和 Google Colab 使用说明。
1. 数据集格式准备(YOLO格式)dataset/│ └── val/│ │ ├── img001.txt # 每行: class_id x_center y_center width height (归一化)│ └── val/└── data.yaml # 数据集配置文件data.yaml 示例nc: 3 # 类别数量2. 启动训练# 从预训练权重开始训练(推荐)# 或从头训练3. 验证模型
<think>我们要求生成≤150字的文章摘要。内容来自用户提供的详细文章。需要提取核心信息:面向超市场景的偷窃行为检测数据集,含2类别、4000张图像,YOLO格式,标注normal和shoplifting,提供数据采集、标注流程、YOLOv8训练指南等。摘要需简洁。 注意要求:≤150字。中文。输出摘要。 先草拟:本文介绍一套超市偷窃行为检测数据集,含2类别(normal/shopliftin
人生不止一片什刹海
本文介绍了面向可见光-红外目标检测的轻量级跨模态融合模块 HAFFormer,源于 LCAFNet 中的双向模态引导交叉注意力与门控融合思想。该模块分别利用可见光和红外特征生成交叉注意力增强表示,在保留原始模态信息的同时充分挖掘纹理细节、热目标响应与边缘结构等互补信息,并通过门控权重自适应分配两种模态贡献。我们将 HAFFormer 成功集成进 YOLO11 的 Neck 特征融合阶段,替代原有拼
ISODATA 迭代阈值分割作为一种自适应阈值方法,核心优势在于无需人工设定阈值,通过迭代优化实现最优分割,适用于多数目标与背景灰度差异明显的图像场景。本文提供的 MATLAB 和 Python 代码均经过验证,可直接复制运行,只需替换图像路径即可适配自己的需求。依赖库导入:使用 OpenCV 读取和处理图像,NumPy 进行数值计算,Matplotlib 实现结果可视化;迭代逻辑:与 MATLA
本文介绍了一个包含6类狗狗行为(吠叫、进食、趴卧、奔跑、端坐、站立)的目标检测数据集,包含近3000张高质量标注图片。文章详细解析了数据集特点、标注规范及技术挑战,并提供了YOLOv8模型训练全流程指南。针对宠物行为识别的独特难点(姿态多样性、背景干扰等),提出了数据增强、模型优化等解决方案。该数据集适用于宠物智能硬件开发,可应用于行为监测、健康分析等场景,支持轻量化部署以满足嵌入式设备需求。数据
Meta 的 Segment Anything Model (SAM) 是一个基于提示的通用图像分割模型,能够根据点、框、文本等交互式提示,对图像中的任何对象生成高质量的分割掩码。其核心在于零样本迁移能力,无需针对特定任务进行训练即可在新领域(如遥感图像)直接应用。
本数据集含3700张真实养殖场景高清图像,精准标注猪仔9类核心行为(饮水、进食、撞击、跪地、拱蹭、休息、站立、吮乳、踩踏),YOLO格式,经三轮专家核验,支持YOLOv8等主流模型直接训练,助力智能养殖与健康监测。
本文介绍了一个包含6,000张标注图像的猫行为检测数据集,涵盖6种核心行为(进食、玩耍、休憩、端坐、伸展、打哈欠)。数据集采用YOLO格式标注,包含多种猫品种、拍摄角度和光照条件。文章详细解析了数据集的构建规范、标注质量控制方法,以及猫行为识别面临的独特挑战(如姿态多样性、毛发遮挡等)。同时提供了YOLOv8模型的训练配置、数据增强策略和优化建议,包括样本均衡处理、小目标检测优化和轻量化部署方案。
1]郭亚楠,黄德启,倪自聪,等.多尺度特征增强与动态采样的轻量化目标检测[J/OL].哈尔滨工业大学学报,1-20[2026-08-17].https://link.cnki.net/urlid/23.1235.T.20260618.1013.004.
本数据集含3000张真实场景单车图像,覆盖城市道路、小区、公园等多元环境,支持YOLO等主流框架。标注精准、格式标准、开箱即用,专为共享单车管理、智慧交通、安防巡检等应用优化。
本项目基于 YOLOv11 与 DOTA v1.0 数据集,实现遥感/航拍图像中的多类别目标检测,并提供完整的训练流程与可视化检测系统
本文介绍了在Carla+ROS环境中实现YOLOv8实时目标检测的两种方案:1) rosbridge+roslibpy方案存在高延迟和丢帧问题;2) 采用TCP直接传输图像数据的方案,通过Python 2.7服务端发送图像数组到Python 3.10客户端进行检测,实现了流畅的实时检测效果。文章详细说明了TCP方案的代码实现和五终端启动流程,并展示了YOLOv8对车辆、行人等目标的检测效果,为后续
本文介绍了一个包含6000+张高质量标注图像的外墙裂缝目标检测数据集,该数据集针对建筑结构健康监测需求,覆盖混凝土、抹灰、瓷砖等多种墙体材料及不同光照条件。数据集采用YOLO格式标注,包含训练/验证/测试标准划分,适用于细长裂缝检测等挑战性场景。文章详细分析了裂缝成因、传统检测方法的局限以及AI视觉检测的技术优势,并提供了YOLOv8模型训练配置和参数优化建议,包括细长目标检测优化、数据增强策略和
CVPR 2026目标检测研究进展摘要:2026年CVPR会议收录了84篇目标检测核心论文和167篇相关检测论文,反映了该领域的快速发展。研究重点包括:1)检测框架创新,如PaQ-DETR提出的动态查询机制和RAVEN的雷达自适应架构;2)模型鲁棒性研究,如AntiStyler防御对抗攻击;3)数据高效方法,如启发式推理先验和合成数据增强;4)跨域应用,包括测试时自适应和标签迁移技术。这些工作展示
现象:训练报错,或者推理出来类别名是乱码/数字。原因:labelImg 里你输入的是年糕,但data.yaml的names写的是niangao;或者顺序错乱,class_id 和名字对不上。解决类别名统一用英文/拼音,避免中文路径和中文类别名踩编码坑。names列表的顺序 = 标注文件里 class_id 的数字顺序(第一个是 0,第二个是 1…)。不确定时,打开任意一个.txt看第一列数字,它必
炼丹思维:"换个模型试试" → "调个参数试试" → "加个增强试试" → "不行就加数据"工程思维:"瓶颈在哪?" → "数据/模型/训练/部署?" → "用什么证据判断?→ "解决这个瓶颈的最高ROI手段是什么?" → "执行 → 验证 → 迭代"目标检测不是一个"调出来"的技术,而是一个诊断出来的技术。每一个性能数字背后都有具体的、可追溯的原因。找到那个原因,比盲目尝试十种新模型更有价值。记
本文介绍了一个包含6类学生课堂行为(举手、阅读、写作、使用手机、低头、睡觉)的2000张图像数据集,覆盖积极和消极行为,支持教育智能化应用。数据集采用YOLO格式标注,适用于目标检测任务,包含训练/验证/测试集。文章详细分析了数据特征、行为类别定义(含ID对照表)、检测难点(如阅读与低头区分),并提供了YOLOv8训练配置建议、模型选择指导和数据增强策略。该数据集可用于智慧教室系统开发、学习专注度
本数据集含2500张真实产线芯片图像,标注4类表面缺陷(工艺划痕、通用划痕、破损、引脚断裂),采用YOLO标准格式,支持小目标检测与工业部署,适用于AI质检、YOLO训练及智能制造研究。
计算机视觉
——计算机视觉
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net