登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍了神经网络中的权重初始化方法,重点分析了Xavier初始化的原理及其在深度学习中的应用。Xavier初始化通过控制权重方差来保持信号在网络中的稳定传播,避免梯度消失或爆炸问题。文章详细推导了Xavier初始化的数学原理,提出应根据输入输出神经元数量确定权重分布范围。在实践部分,介绍了数据预处理(缺失值填充、标准化、独热编码)、模型设计、训练优化等关键步骤,并提供了K折交叉验证的实现方法。特
今天我们来学习一个在人工智能绘画和生成模型领域非常火热的模型——概率扩散模型(Probabilistic Diffusion Model, DDM)。
前向传播(forward propagation或forward pass) 指的是:按顺序(从输入层到输出层)计算和存储神经网络中每层的结果。假设输入样本是 x∈Rd, 并且我们的隐藏层不包括偏置项。zW1x其中W(1)∈Rh×d 是隐藏层的权重参数。hϕz隐藏变量h也是一个中间变量。假设输出层的参数只有权重W(2)∈Rq×h, 我们可以得到输出层变量,它是一个长度为q的向量oW2h假设损失函数
25年8月来自的论文“Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey”。机器人操控是机器人技术和具身人工智能的关键前沿,需要精确的运动控制以及对动态环境中视觉和语义线索的综合理解。传统方法基于预定义的任务规范和严格的控制策略,往往难以在非结构化的新场景中扩展或推广。近年来,基于在海量图
室内差速转向移动机器人以安全灵活全方位灵活为根基,以强大自主导航避障为核心,以开放可扩展为灵魂,其中移动机器人的自主导航与自主避障系统不仅确保了机器人的基本运行能力,更是通过 “精准、安全、灵活” 的特性,为各领域的智能化应用提供了可靠支撑。教育科研先锋:作为高校及研究机构的理想平台,差速转向移动机器人完美支持ROS(机器人操作系统)、MPRT、PIXHAWK等开源项目,助力开展机器人学、人工智能
投稿注意事项 | 论文检索周期 |论文 | 投稿参会优惠 | 更多。
文章摘要 本文讨论了机器学习中的过拟合和欠拟合问题,并介绍了两种常见的正则化方法:权重衰减和Dropout。过拟合指模型在训练数据上表现良好但在测试数据上表现差,而欠拟合则是模型无法捕捉数据的基本模式。权重衰减通过L1/L2范数对模型参数进行约束,其中L2正则化(岭回归)能均匀分布权重,L1正则化(套索回归)可实现特征选择。实验表明,适当的L2正则化能有效降低过拟合。Dropout是另一种正则化技
疟疾是一种由疟原虫(Plasmodium)引起的严重传染病,尤其是 恶性疟原虫(Plasmodium falciparum),对人类健康威胁极大。传统的诊断方法主要依赖显微镜观察血涂片,这不仅需要专业人员长期训练,而且效率低、易受主观因素影响。随着 人工智能与深度学习技术 的发展,基于显微镜图像的自动检测与识别逐渐成为疟疾诊断的新方向。
智能智造融合了人工智能、物联网、大数据等前沿技术,而机电一体化则通过智能化与自动化创新,推动制造业向高效、精准方向迈进。近年来,工业机器人、智能工厂等技术的崛起,进一步加速了智能智造与机电一体化的深度融合。会议由南昌理工学院与江西省工程师联合会联合主办,邀请国内外专家围绕关键技术、应用场景及产业生态等议题展开深入交流,为学术界与产业界提供高水平的合作平台。承办单位:南昌理工学院航天航空学院、南昌理
为了解决这个问题,已经有一些努力正在进行,包括在**模型卡(model cards)**中系统地报告模型的风险、局限性和偏见。此外,在实体店中,计算机视觉系统可以跟踪库存水平、检测缺货情况,甚至分析顾客行为,以优化店铺布局和营销策略,最终帮助他们提升门店。要评估它,你必须理解手头的问题。更复杂的是,偏见可能在模型开发的任何阶段出现:数据、人工智能设计、部署和模型应用。在装配线上应用计算机视觉进行质
计算机-人工智能-检索辅助fMRI解码图像重建
视觉是人类感知世界的基础能力,其复杂机制远超简单的光线捕捉。本文探讨了视觉对人类认知的重要性,以及计算机视觉如何模仿这一过程。人类无需明确规则即可快速识别物体(如踢球时的动态判断),而传统编程却难以定义"球"这样简单的概念。通过分析视觉的上下文依赖性和隐含理解,文章揭示了开发人工智能视觉系统的必要性。计算机视觉不仅能复制人类能力,还能解决人类难以完成的任务,如体育赛事实时分析。
随着人工智能技术的飞速发展,大语言模型(Large Language Models, LLMs)已成为当前AI领域最具影响力的技术之一。从ChatGPT到Claude,从LLama到DeepSeek,这些大模型正在改变我们与技术交互的方式,并在各行各业带来革命性变革。
多模态训练是指在机器学习和人工智能领域,同时利用多种不同类型的输入数据(如文本、图像、音频、视频等)进行模型训练的过程。这种训练方式旨在让模型能够更好地理解和处理来自不同模态的信息,从而提高模型在复杂场景下的性能和泛化能力。例如,在自动驾驶场景中,车辆需要同时处理摄像头捕捉的图像数据、雷达传感器的点云数据以及车载麦克风收集的音频数据,以准确判断路况并做出决策。多模态训练的目的是让模型能够像人类一样
上海人工智能实验室等机构提出DynamicCity框架,突破4D大场景生成技术。该研究通过HexPlane特征降维和扩散模型,实现了动态城市场景的高效建模,支持轨迹引导、指令驱动等可控生成方式。相比现有静态生成方法,DynamicCity在生成质量、训练速度和内存消耗方面取得显著进步,为自动驾驶仿真等应用提供了更真实的虚拟环境。该成果已被ICLR2025接收为Spotlight论文。
在当今数字化与智能化飞速发展的时代,深度学习作为人工智能领域的核心技术,正以前所未有的速度改变着我们生活的方方面面。从图像识别到自然语言处理,从医疗诊断到智能安防,深度学习模型的强大能力不断突破人们的想象。而这一切令人瞩目的成就背后,高质量的数据无疑是推动其发展的关键动力。在众多数据来源中,安检 DR 数据正逐渐崭露头角,尤其是通过自主采集获得的非涉密安检 DR 数据,为深度学习训练带来了独特且巨
《揭秘卷积神经网络:图像识别的核心技术》摘要: 卷积神经网络(CNN)是图像识别领域的核心算法,其灵感源自生物视觉系统。典型CNN结构包含卷积层(特征提取)、池化层(降维处理)和全连接层(分类输出)三大部分。从1998年LeNet-5到2012年革命性的AlexNet,CNN架构持续进化,在图像分类、目标检测等任务中表现卓越。初学者可通过学习数学基础、编程技能,使用TensorFlow等框架实践入
【AI领域学术征稿速递】近期多本SCI期刊推出人工智能专题专刊,涵盖安全应用、智能运输、无线传感网、数学方法及可持续电网等方向。重点推荐: 1️⃣ IET Information Security(IF1.3)聚焦AI驱动的安全防御(截稿2025/6/30) 2️⃣ IET Intelligent Transport Systems(IF2.3)关注智能运输(截稿2025/8/31) 3️⃣ Sc
摘要:本文提出了一种基于改进长短焦图像融合技术的轨道交通障碍物检测系统。通过结合SIFT特征提取与相位相关法,开发了创新配准算法,将边缘对齐误差降低87.5%至0.27像素。采用YOLO11目标检测模型,系统在融合长短焦图像后,检测性能显著提升,mAP50-95指标从64.19%提高到81.32%。实验证明,该方法有效整合了长焦相机的高分辨率细节与短焦相机的广角优势,为提升轨道交通安全检测提供了可
框架通过融合运动预测与Transformer外观建模,在SportsMOT与MOT17均达SOTA。该数据集有望推动体育分析与多目标跟踪算法的协同发展。在SportsMOT上提升显著:ByteTrack + MixSort使HOTA↑1.6,IDF1↑2.7(表3)。在MOT17上刷新SOTA:HOTA达64.0(表5),证明泛化能力。填补了体育场景MOT数据集的空白,其。特性挑战现有跟踪范式。
数据增强方法适用的YOLO版本数学原理相关论文图像缩放将输入图像缩放到固定大小(如448x448),以适应网络输入。随机裁剪从原始图像中随机裁剪出部分区域进行训练,增加样本多样性。随机翻转对图像进行水平翻转,增强模型对目标方向变化的鲁棒性。颜色抖动随机调整图像的亮度、对比度、饱和度和色调,增加数据多样性。随机缩放在训练过程中随机缩放图像,以适应不同尺寸的目标。Mosaic将四张图像拼接在一起形成一
此次大会旨在汇聚全球在计算机视觉与艺术领域内的研究者、工程师、科学家和行业专家,共同探讨和分享这一跨学科领域内的最新研究成果、技术进展和创新应用。本次会议将提供一个优质的交流平台,参与者将有机会了解领域内的最新研究趋势、面临的挑战与机遇,以及未来可能的发展方向。
模型部署超详细教程,零基础小白。
会议将围绕图像与视觉处理,机器学习等在计算机领域中的最新研究成果,为来自国内外高等院校、科学研究所、企事业单位的专家、教授、学者、工程师等提供一个分享专业经验,扩大专业网络,面对面交流新思想以及展示研究成果的国际平台,探讨本领域发展所面临的关键性挑战问题和研究方向,以期推动该领域理论、技术在高校和企业的发展和应用,也为参会者建立业务或研究上的联系以及寻找未来事业上的全球合作伙伴。
Learning A Sparse Transformer Network for Effective Image Deraining基于Transformer的方法在图像去雨任务中取得了显著的性能,因为它们可以对重要的非局部信息进行建模,这对高质量的图像重建至关重要。本文发现大多数现有的Transformer通常使用查询-键对中的所有token的相似性进行特征聚合。然而,如果查询中的token与
目录一、DenseNet网络的背景二、DenseNet网络结构四、DenseNet优缺点五、DenseNet代码实现一、DenseNet网络的背景DenseNet模型的基本思路与ResNet一致,但它建立的是前面所有层与后面层的密集连接(即相加变连结),它的名称也是由此而来。DenseNet的另一大特色是通过特征在通道上的连接来实现特征重用。这些特点让DenseNet的参数量和计算成本都变得更少
图像在计算机内部本质上就是数组,如果要对图像进行修改,本质上就是对数组(像素点)进行修改。因此,处理图像时(除了改变缩放,旋转,镜像等等)需要先转化为数组(二值化以及归一化),然后处理完毕后在转换回去。即先np.array()再Image.fromarray()图像预处理:为了提高图像质量,减少系统误差,提高效率,我们要先灰度处理(必有,但是无法恢复到RGB,因此我们必须保证灰度处理不影响我们目标
浅层网络更注重于细节信息深层网络更注重于语义信息浅层网络:一般感受野较小,能够利用更多的细粒度特征信息,而且此时特征图每个像素点对应的感受野重叠区域还很小,这就保证了网络能够捕获更多细节。深层网络:随着下采样或卷积次数增加,感受野逐渐增加,感受野之间重叠区域也不断增加,此时的像素点代表的信息是一个区域的信息,获得的是这块区域或相邻区域之间的特征信息,相对不够细粒度,但语义信息丰富。低级特征来源于浅
【计算机视觉 | 目标检测】arxiv 计算机视觉关于目标检测的学术速递(6月 30 日论文合集)