登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍 Ultralytics Detect3D 的完整实现与使用流程,包括 KITTI 数据准备、YOLO26n/s 模型训练、KITTI R40 验证、3D 框可视化以及 ONNX Runtime 部署,并分享预训练权重、实验指标和实际使用中的常见问题。
消费端:普通人手机拍几张照片,快速生成高清3D手办(i-W/2、j-H/2)雕塑(i-W/2、j-H/2)家具模型,不用专业扫描设备;机器人领域:巡检机器人少量视觉帧即可完成自身环境高精度3D重建,无预先标定流程;VR/AR:室内空间快速实景建模,降低虚拟场景制作成本;工业质检:设备局部少量照片重建三维模型,用于尺寸偏差检测。该方法是目前稀疏无标定3D高斯重建最优工程方案,也是人大王永才课题组TV
范式创新:提出map-in-the-loop任务驱动闭环,导航损失梯度反向更新地图生成模块,打破地图与决策解耦的传统VLN架构;表征创新:三通道精简BEV地图,只保留导航必需的占用、距离、地标信息,摒弃无意义完整环境重建;训练创新:监督预训练打底+GRPO分组强化联合微调,同时优化地图生成器与导航策略;落地优势:单目RGB输入、轻量化低分辨率地图,人形机器人嵌入式设备可实时推理,仿真到真实环境零样
Super-LIO提出了一种面向资源受限平台的高效激光惯性里程计系统,通过优化地图结构和近邻搜索策略显著提升性能。核心创新包括:1)OctVox紧凑地图结构,将体素划分为2×2×2子体素,每个子体素仅维护一个代表点,实现空间密度控制;2)HKNN启发式近邻搜索,利用预计算候选列表和几何距离剪枝加速匹配。实验表明,系统在X86和ARM平台上分别实现3.7×和4.2×加速,同时保持优于基线方法的精度。
多传感器融合通过综合不同传感器的互补信息,在统一时空基准和概率模型下实现更准确、鲁棒的状态估计。本文系统阐述了多传感器融合的本质、概率基础及分类方法。首先指出融合的核心是利用多源信息在不确定性条件下进行联合推断,其本质是对不确定性的量化与传递。然后从贝叶斯估计角度解释了融合的概率基础。重点提出三条分类轴:按信息抽象层级分为数据级、特征级和决策级;按耦合程度分为松耦合、紧耦合和深耦合;按系统拓扑分为
一、全景影像采集——把真实世界装进数据库。消费级四足机器人(机器狗)搭载全景设备,按编程路径自动完成多高度采集,与地面、无人机数据合并为完整三维模型。空间数据的价值不在数据本身,而在应用场景——数字文旅学生既懂场景又懂技术,天然处于“场景理解—数据采集—内容创作”的交叉点。技术能力备注:本文涉及的VR全景影像库(61项世界遗产、240余遗产地)、数字人动作生成与人景合一融合技术(均已获发明专利)、
在热传导物理与数值计算领域,3D 热传导方程是描述三维物体温度随时间变化的核心模型 —— 从食品加工(如鸡蛋烹饪)到材料热处理(如金属淬火),其数值求解均具有重要工程价值。本文聚焦 “鸡蛋烹饪的温度演化” 这一具体场景,基于 MATLAB 实现 3D 热传导方程的求解,通过欧拉法(Euler Method)计算 3D 网格中每一点的温度变化,同时解析代码逻辑、参数设置与结果可视化,还将关联 1D/
摘要: 随着3D打印技术的广泛应用,其打印质量的自动检测与控制成为保障制造效率与产品质量的关键环节。传统的缺陷检测方法依赖人工目视,存在效率低下、主观性强、难以实现连续监控等弊端。本研究提出并实现了一个基于深度学习与Web技术的智能化3D打印缺陷在线检测系统。系统核心采用先进的YOLOv8/YOLOv10/YOLOv11/YOLOv12目标检测算法,对三种常见打印缺陷(拉丝、毛刺、垂料)进行高精度
分布式渲染是一种将复杂渲染任务拆解为海量子任务,分配至多个计算节点并行处理,最终整合结果的技术范式。这些节点可是本地局域网内的设备,也能是跨地域的服务器,核心优势在于通过并行计算大幅缩短渲染耗时 —— 例如单帧需 10 小时的 4K 效果图,经 480 线程分布式处理可压缩至 1 小时内。在影视领域,《寻梦环游记》通过云端分布式渲染实现细腻光影效果,将单帧数小时的渲染周期压缩至合理范围;云渲染则是
Camera:给自动驾驶“理解世界的语义能力”——车道、灯、牌、类别、规则LiDAR:给自动驾驶“可靠的三维几何能力”——距离、结构、建图与定位特征Radar:给自动驾驶“全天候的动态感知能力”——远距、速度、雨雾冗余IMU:给自动驾驶“高频连续的运动状态”——姿态、去畸变、短时连续性GNSS:给自动驾驶“全局绝对基准”——全球坐标与长期不漂的参考关键能力有冗余退化模式可控标定与同步可靠融合策略能
记录下echarts Map3D地图渐变
Highcharts 3D图表功能详解:支持柱状图、饼图、散点图等类型,需引入highcharts-3d.js模块。通过options3d配置旋转角度、深度等参数,其中3D饼图最常用。注意3D效果可能导致视角误导,建议谨慎使用。提供完整示例代码,包括3D饼图、柱状图和散点图实现方法,支持交互旋转等特性。
通过3D建模技术,开发者可构建立体化仓储网络,实时展示货物位置、运输车辆轨迹及配送路线。结合腾讯位置服务的专属货运路线策略,有效规避限行区域,降低15%以上的物流成本。某头部快递企业接入后,分拣准确率提升至99.3%,客户投诉率下降42%。
依托专门的指令重写模块,系统能将模糊的用户描述转化为包含动作细节与精确时长的结构化指令,实现对创作意图的深度解析与精准响应。开发者、动画师及科研人员提效利器的同时,也通过降低创作门槛,让每一位个人创作者都能拥有挥洒创意、驱动数字生命的能力。通过引入针对语义匹配与物理约束的奖励模型,确保生成的动作既能精准契合文本意图,又在生理结构上保持合理自然。有开发者也尝试将我们输出的结果作为视频生成模型的控制信
DETR3D将DETR的集合预测范式引入多视角3D检测:用可学习的3D参考点代替2Danchor,通过3D→2D投影从多视角图像中采样特征,实现端到端的NMS-free 3D检测。
传统雷达-相机融合方法大多先将不同模态统一到 BEV 空间,再进行拼接或注意力融合。但这种方式默认两种模态在 BEV 中已经较好对齐,而现实中雷达特征往往稀疏、相机 BEV 又容易受深度误差影响。CVPR 2025 的 RaCFormer 提出了一种 query-based 的双视角融合框架,让 object query 同时从图像视角和 BEV 视角主动采样特征,并结合雷达辅助深度估计、时序动态
它没有搞复杂的模型架构,而是从采样策略入手,用简单的OLC策略解决了“找新类别、控成本”的核心问题,再结合CRB形成Open-CRB框架,既保证性能,又兼顾实用性。简单说,这个任务的目标是:用最少的标注成本,让3D检测模型适应真实开放场景,既能认熟类别,又能识别没见过的新类别。最近,Zhuoxiao Chen等学者提出的Open-CRB框架,首次把3D目标检测主动学习带入了“开放世界”,用极低的标
LSM6DSV16XTR是意法半导体推出的高性能六轴IMU芯片,集成3D加速度计和陀螺仪,采用2.5×3mm紧凑封装。其核心创新包括:1)三核架构实现多任务并行处理;2)嵌入式MLC支持运动模式识别;3)低功耗SFLP算法实现高效姿态解算;4)Qvar技术实现无接触手势控制。该芯片工作电流仅0.65mA,支持±16g加速度和±4000°/s角速度测量,通过I²C/SPI接口通信,内置4.5KB F
本文深度剖析了四大主流3D视觉感知技术:双目视觉、结构光、iToF和dToF。双目视觉成本低但依赖光照和纹理;结构光近距离精度高但测距有限;iToF产业链成熟但存在多径干扰;dToF凭借直接测量光子飞行时间的优势,在中远距离、强光环境等场景表现突出,正成为机器人和自动驾驶领域的新星。市场数据显示,dToF增速远超iToF,在工业与汽车应用前景广阔。文章还介绍了dToF技术演进方向和典型产品,指出其
CVPR 2025 的 CorrBEV 关注的不是传统 3D 检测里“平均分再涨一点”,而是一个更接近真实落地的问题:遮挡目标漏检。论文借鉴人类的 amodal perception,引入视觉原型和语言原型作为先验知识,再通过 correlation learning 注入到 3D query 学习中,同时结合随机像素丢弃和多模态对比学习增强训练。它的意义不只是提升了整体 3D 检测性能,更重要的
先给所有已经在玩 ComfyUI、本地大模型、AI 配音的朋友一个定死的结论:你之前花时间学的所有 AI 技能,全部能无缝搬进 Unity 里做 3D 游戏,不用重新学一套。而且比你纯做 AI 绘图、纯做漫剧强太多了 —— 你可以把 AI 生成的所有素材,变成一个真正能玩、能互动、能打包成 PC / 手机端的 3D 游戏。这篇文章就是写给和我一样,手里有 A770 16G 显卡,已经搭好了本地 A
工业机器人普及下的人机协同作业面临传统二维防护设备盲区大、误报率高、部署僵化等痛点,机械伤害事故占比居高不下。洛微科技推出D系列ToF 3D立体安全防护相机解决方案,通过原生三维感知(0.2-5m监测范围/103°×81°超大视场)和多级分区防护,实现注塑机、机械臂等场景的全空间无死角防护。该方案支持虚拟围栏动态调整,适配柔性产线快速换型需求,已成功应用于新能源、3C等行业,年均可为企业减少数十万
本文探讨了移动机器人3D视觉相机的选型方法。首先介绍了双目视觉、结构光、iToF和dToF四种主流技术的特性及适用场景,提出技术路线需要根据任务需求组合选择。随后提出"五问法"选型框架:明确任务类型(感知/避障/抓取等)、工作距离与视场角、目标特性(材质/尺寸)、工作环境(光照/干扰)、系统集成要求。通过人形机器人三个典型场景的选型示例,展示了如何运用该方法。最后指出常见误区,
应急事故溯源往往时间紧迫,需求多变。CIMPro孪大师的零代码开发特性,让安全人员可以通过拖拽式操作,快速调整事故还原场景、修改应急流程、标注关键位置。
使用 DeepSeek V4 Pro / V4 Flash 的 thinking mode + tool calls 时,第一轮工具调用后的每次请求都返回。在 Claude Code 和 DeepSeek API 之间插入一个本地 Node.js 代理,自动补全被丢弃的 thinking 字段。的消息必须保留 thinking 块。Claude Code / cc-switch 在序列化历史时把它
大家好 这里是「代码简单说`,欢迎大家关注同名公众号,不定时更新更多实用有趣的教程 也欢迎大家在评论区一起讨论交流!
现在,我们来加点难度,让 Codex 追一条更具体的路线:当用户写了一个 Typer 应用,并在终端里运行它时,代码大概会经过哪些关键步骤。Codex 这一步做的事情,就是先帮我们把项目拆开:哪些文件是入口,哪些目录是源码,哪些地方是测试,哪些地方是文档。这样一来,Typer 的核心代码就有了一条比较清楚的阅读路线:先看对外入口,再看主流程,然后看参数定义和内部数据结构,最后再进入底层命令行为。这
本文介绍了3D激光雷达点云处理的基础知识,包括点云数据结构(ROS2的PointCloud2消息、PCL和Open3D库中的点云类型)、主流文件格式(PCD、PLY、LAS/LAZ)及其应用场景,以及点云可视化的方法。文章还分享了面试应对策略,建议从数据结构、文件格式到处理流程分层次讲解,并强调性能优化经验的重要性。最后预告下一篇将深入讲解点云滤波算法。全文旨在为机器人开发和自动驾驶领域的工程师提
如果你是一名前端开发,你一定知道——做一块数据大屏要多久?传统方式:设计稿 → 切图 → 搭场景 → 调材质灯光 → 写交互 → 接数据 → 反复修改 → 交付。3D 大屏更复杂,Three.js 的坐标系、材质、光照每一项都能让你 debug 一整天。一个熟练的 Three.js 开发,做出本文这个效果,保守估计 3~5 天。
Spatial-TTT最值得关注的,不只是一个2B模型在多个空间智能基准上的领先成绩,它还提供了一种重新理解长视频记忆问题的方式。传统长上下文方案试图保留更多历史内容,Spatial-TTT则进一步追问:模型能否将持续到来的视觉观察,转化为一份能够不断更新、修正和调用的内部空间状态?它不需要永久保存每一帧画面,却需要知道自己经过了哪里、看到了什么,以及空间关系如何随着新的观察发生变化。这对于真正进
3d
——3d
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net