登录社区云,与社区用户共同成长
邀请您加入社区
坐标北京,具身智能,三维重建方向,1-3年;坐标苏州,具身智能,深度学习方向,3-5年。
定位要解决的是机器人的「位姿」(Pose)问题。位置(Position):机器人在空间中的坐标(x, y, z)姿态(Orientation):机器人的朝向(roll, pitch, yaw,即横滚、俯仰、偏航)在二维平面移动的机器人(如轮式机器人),位姿是 3 维的(x, y, yaw);在三维空间移动的机器人(如无人机、人形机器人),位姿是 6 维的(x, y, z, roll, pitch,
对于机器人、工业视觉、智慧交通、无人系统等应用而言,国产替代的重点已经从“有没有产品”转向“能否在实际项目中完成替代”。
中国科学院云南天文台联合山东大学、长春光学精密机械与物理研究所,开展了50毫米球载白光日冕仪(BBWLC)科学飞行实验,采用鑫图光电 Dhyana 95 科学相机完成了近空间环境下的白光日冕观测验证。相关成果于2025年发表于《Research in Astronomy and Astrophysics》。
本文介绍了ICCV 2025的工作《GWM: Towards Scalable Gaussian World Models for Robotic Manipulation》,提出了一种基于3D高斯表示的新型世界模型Gaussian World Model (GWM)。该模型通过结合3D高斯溅射与扩散Transformer,实现了机器人操作任务中未来场景的准确预测。GWM包含两个核心组件:3D高斯
🏆 本文收录于 《YOLOv9实战:从入门到深度优化》 专栏。该专栏系统复现并深度梳理全网主流 YOLOv9 改进方法与工程实战案例,覆盖分类、目标检测、实例分割、多目标追踪、关键点检测、旋转目标检测等多个方向,坚持 持续更新 + 深度解析 + 工程验证。
2026年8月,Skild Art面向南山区科技创新局相关业务交流与企业能力披露场景,完成CLI与SKILL功能接口升级,进一步开放视频、图像和画布能力的调用入口。本次升级重点展示企业在AI视觉技术开放、AI Agent协同接入和产业应用落地方面的产品能力,为南山人工智能产业生态中的企业服务、内容生产和数字化应用提供可复用的技术接口。通过更轻量的接入方式,开发者、产品团队和企业用户无需进行复杂的A
熔池相机技术原理与应用摘要 熔池相机是焊接机器人的核心视觉传感器,通过多光谱滤波(800-1100nm近红外)、高动态成像(120dB+)和主动光源补偿三大技术突破强弧光干扰,实现熔池清晰成像。其工业级硬件设计包含窄带滤光系统、水冷/气冷防护结构和实时处理单元(FPGA+ARM),支持GigE Vision/USB3.0接口。相机按功能分为监控型、跟踪型、缺陷检测型和立体视觉型,关键技术参数包括分
这几年,Transformer 几乎已经成为人工智能领域绕不开的一个名字。无论是我们熟悉的大语言模型,还是文本生成、机器翻译、图像理解、多模态模型,背后都能看到 Transformer 的影子。AttentionQ、K、VEncoderDecoderTransformer 好像就是由一堆复杂的矩阵运算拼起来的。如果只是停留在这个层面,我们确实可以把 Transformer 的公式背下来,甚至把代码
以往 Flash = 便宜 + 快 + 智力阉割;现在,1/40 的价格,在 Agent 基准上打平旗舰,“砍智力换低价”的行业惯例被正面击穿。但它也不是最便宜的多模态模型。
医疗影像是YOLO落地价值非常高的垂直领域,但也是对细节要求最苛刻的场景之一。从窗宽窗位的调整、锚框的重新聚类,到小目标检测层的添加、损失函数的优化,再到后处理的先验过滤,每一个细节都在影响最终的临床效果。它考验的不只是算法能力,更是对医疗场景的理解和对细节的把控。不要指望拿通用模型改改输入就能达到临床可用,沉下心把数据处理好、把结构改到位、把训练策略做扎实,一步一步优化,才能真正做出有实用价值的
第三章 李群与李代数(第四讲)群(Group):是一种集合加上一种运算的代数结构。把集合记作A,运算记作.,则群可记作G=(A,.)。群满足以下几个条件:矩阵中常见的群有:
自动驾驶运动控制算法十年演进(2015-2025)摘要 自动驾驶运动控制算法经历了从基础辅助到高阶智能的跨越式发展。2015-2017年,经典PID控制主导L0-L1辅助驾驶,海外Tier1垄断市场;2018-2020年,线性MPC实现横纵一体化控制,国产厂商突破技术壁垒;2021-2023年,非线性智能控制算法支持城市NOA复杂场景,国产方案实现反超;2024-2025年,端到端大模型原生控制将
王鹤,北京大学前沿计算研究中心助理教授,本科毕业于清华大学,博士毕业于斯坦福大学,师从美国三院院士Leonidas. J Guibas教授。他创立并领导了具身感知与交互实验室(EPIC Lab),实验室立足三维视觉感知与机器人学,重点关注具身机器人在三维复杂环境中的感知和交互问题,研究目标是以可扩增地方式发展高泛化性的机器人视觉和控制系统。研究成果覆盖物体抓取、功能性操控、灵巧操作及寻物导航。
摘要: 2015-2025年,运动控制算法经历了从经典PID到神经控制的革命性演进。早期(2015-2018)以高精插补和线性控制为主,实现刚性精确但适应性差;中期(2019-2022)引入非线性MPC和全身控制,提升敏捷性与交互能力;2025年进入神经控制时代,端到端模型结合eBPF内核级实时审计,实现物理直觉与安全自愈。技术跨越体现为控制频率提升100倍、动力学建模从手写方程转向自适应神经场,
深度强化学习实验室来源:https://arxiv.org/abs/2011.12895v1编辑:DeepRL基于竞争性自学(CSP)的多智能体强化学习(MARL)最近表现出了出惊人的突...
【代码】视觉slam14讲 逐行解析代码 ch7 / orb_self.cpp。
p0 = cv2.goodFeaturesToTrack(old_gray, mask=None, **feature_params)#选取好的特征点,返回特征点列表。a,b = new.ravel() #ravel()函数用于降维并且不产生副本。
本文介绍了pytorch中的torch.cuda.amp.autocast
PX4无人机集成自带的深度相机进行gazebo仿真
有一个主网络和很多的worker。A3C把主网络的参数直接赋予worker中的网络,更新时。该架构依赖于优先记忆重放,只关注actor生成的最重要的数据。强化学习收敛速度慢,采用并行计算可以加快计算速度。与环境进行交互,产生的数据存储在。,对主网络的参数进行更新。
lerobot数据格式v2和v3的比较
cuda核函数处理图像像素的执行逻辑
强化学习中的无监督表征学习:对比学习框架本文介绍了一种用于强化学习的无监督表征学习框架,名为“对比学习”。核心概念:无监督学习: 框架不需要任何标签或奖励信号,仅依赖于观察数据进行学习。表征学习: 框架学习输入数据的中间表征,这些表征对下游任务(如强化学习)有用。对比学习: 框架利用对比学习方法训练,通过比较不同数据样本的相似性来学习表征。框架结构:框架包含一个强化学习模块,用...
可穿戴人工智能或自我人工智能本质上是一种机器人应用。智能眼镜、神经腕带和 AR 耳机(Meta Project Aria、VisionPro)等设备使用人工智能来感知用户的环境、理解空间背景并做出预测。
cv::cuda::DescriptorMatcher 是 OpenCV 的 CUDA 模块中用于在 GPU 上执行特征描述符匹配的类。它允许你利用 NVIDIA GPU 的并行计算能力来加速特征匹配过程,这对于需要实时处理或处理大规模数据集的应用来说非常有用。
S为由状态构成的集合, 状态可以是离散的, 也可以是连续的;由于强化学习在制导律设计上展现出了独特的优势, 受此启发, 本文采用强化学习算法, 针对具有落角约束的制导问题展开研究, 并与传统的最优制导律(扩展比例制导律)对比分析, 验证了强化学习制导律的有效性和对战场环境的适应性。为分析目标为低速面目标时的制导律特性, 令动目标匀速直线运动, 以目标速度为15 m/s, 速度方向服从均匀分布[-π
最近在做视频镜头切换检测功能,需要用 OpenCV 计算某一帧图像的直方图,于是尝试着在 Linux 上编译安装 OpenCV。
视觉slam14讲ch5 opencv安装 ubuntu20.04最近在学习视觉slam14讲第五章时,由于opencv需要较多依赖项,安装过程经历了一些曲折,在此进行记录。1.下载opencv工程opencv下载这里采用了和树上一致的版本,opencv3.1.0,选择...
本文为原创技术解析,引用来源:陌讯技术白皮书。
在强化学习中,经常会面临梯度更新过大,导致训练不稳定,甚至崩溃的问题。为了解决该问题,诞生了TPRO(Trust Region Policy Optimization,TRPO)算法。TPRO算法实现起来比较复杂,需要二阶优化,并且与包括噪声(诸如丢弃)或参数共享(在策略和值函数之间,或与辅助任务)的架构不兼容。针对这些问题,本论文提出了PPO算法。
视觉slam基础知识
测试环境:Jetson Xavier NX,数据来源:陌汛技术白皮书2024-Q2。:您在道路异常检测中遇到哪些光学干扰问题?如何平衡检测精度与实时性的矛盾?其中 α,β,γ 为自适应权重参数,通过LSTM动态调整[6]。,其中积水误判是核心诱因。据交通部2024年道路事故分析报告,。(来源:陌讯技术白皮书Fig.3.2)图1:道路积水识别典型干扰场景。
1.添加find_package。完整版cMakeList.txt。3.添加target。
1.理解光流法跟踪特征点的原理。2.理解直接法是如何估计相机位姿的。3.使用g2o进行直接法的计算。视觉SLAM十四讲ch7_2_哔哩哔哩_bilibili一、直接法的引出视觉slam十四讲学习笔记(六)视觉里程计 1-CSDN博客介绍了使用特征点估计相机运动的方法。尽管特征点法在视觉里程计中占据主流地位,但有以下几个缺点:关键点的提取与描述子的计算非常耗时。实践当中,SIFT目前在CPU 上是无
简而言之就是GPU硬件的版本号,代表了当前的硬件能支持哪些操作、指令。原文版本The compute capability of a device is represented by a version number, also sometimes called its “SM version”. This version number identifies the features suppor
我们已知的是已经发生畸变的图像,目的是去除畸变,得到未发生畸变的原始图像,这个过程就是图像去畸变。首先新建一个大小和畸变图像一样的图像矩阵,来存储去畸变之后的图像,也可以认为是发生畸变之前的原图。对新建图像的每一对坐标(u,v),按照畸变模型,计算点(u,v)对应到畸变图像中的坐标(ud,vd),则点(ud,vd)处的像素值即对应新图像(u,v)处的像素值,将(ud,vd)处的像素值赋值给(u,v
基于ros2 Galactic和Image Pipeline软件包对相机标定
我们首先从数据集读取入手,包括读取数据集的参数文件来获得相机的内参和外参,以及读取图片,因此,我们还需要抽象出相机类、数据集类、参数配置类。相机类最简单,我们先来实现它。
【IEEE出版、马来西亚理工大学主办】2026 第五届云计算、性能计算与深度学习国际学术会议(CCPCDL 2026)
验收那天,客户说"再等等,快了"——这一等,就是半年。客户在产线上转一圈,说:"先别急,内部再确认下,快了。一个缺陷检不出来,多熬几个通宵,多测几种成像方案,多训练几个深度学习模型,总能给出方案。这些难,看得见,咬牙就过去了。客户说"快了"就是约定,客户说"流程走完"就是约定——可这些话,没一句能当证据。先小人后君子,把账算在前面,才是对客户负责,也是对自己负责。我们呼吁客户,要手下留情,给行业留
最后想多说一句。aigcbiye的数据分析功能,定位是“辅助完成实证论文的数据处理与结果撰写”,不是“替代你做研究”。你的研究假设需要你自己提,问卷需要你自己设计,数据需要你自己采集和清洗。它能帮你做的,是把你已经做好的前期工作,用更规范、更高效的方式变成论文里的内容。它更接近于一个“懂统计的写作助手”——帮你处理那些重复性的运算和格式化的工作,让你把精力花在真正重要的地方:思考你的研究问题,解释
在新能源汽车的电驱系统里,在手术机器人的关节中,在高端无人机的旋翼下,有一个不起眼的“隐形卫士”正在默默运转——它就是精密电机轴承。当转速突破万转,当公差压缩至微米级,任何一个微小的尺寸偏差都可能导致整机失效。今天,我们就走进精密测量的现场,看看HM-1120在线图像测量仪如何为高品质电机轴承“保驾护航”。
如果有每个图所在的POI(店铺/景点)text信息,对比学习可以把这些POI信息融入,用POI给图片更多区分度:(实现了跨卡对比学习)提升负例难度,可以准备相似的其他POI作为负例,比如把 POI类目 相同的POI聚到一个batch里。又尝试了卡相似度阈值卡正负例:就是用Base模型的emb,在训练时算相似度,给正负例卡阈值分数;用站内的美食+风景图片微调Qwen3-VL-2B-Embedding
本周优化聚焦提升PDF文档问答系统的工程能力,主要包含以下改进: 双层缓存机制:通过文档哈希缓存OCR中间结果,通过问题参数哈希缓存最终答案,大幅减少重复处理耗时。文档缓存默认开启,答案缓存按需启用。 性能监控:新增TimingRecorder模块,精确记录PDF解析、OCR处理、VLM生成等11个阶段的耗时,便于性能分析和优化定位。 提示词优化:实现prompt类型自动推断(通用/表格/标题/总
镜像视界浙江科技有限公司全栈自研SpaceOS空间智能操作系统底座,整套体系并非在原有安防平台之上做二次封装,而是从零搭建空间计算内核,搭载八大自研空间引擎矩阵,从时空基准、像素解算、拓扑组网、多源融合、智能研判全链路原生设计,不再仅仅做视频画面的简单汇聚,而是完成多路异构视频的空间归一化,打通设备层、空间层、业务层三层孤岛,真正实现全域空间感知,整套技术在底层理论原创、复杂场景适配、工程落地实战
摘要: 该AI技能专为兰花养护设计,通过分析高清图像(含透明盆内根系)智能识别三大核心指标:新芽数量、花梗长度和根系健康状态(白/褐/黑)。系统自动生成结构化报告,包含生长活力评级(旺盛/正常/衰弱)及养护建议(如"新芽3个,健康根占70%,建议增施磷钾肥"),支持图片/视频输入及云端历史报告查询。应用场景涵盖家庭养护、兰园管理等,帮助用户精准掌握植株状态,优化水肥管理。关键约束包括禁止手动汇总报
计算机视觉
——计算机视觉
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net