
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
数值格式-> 校准/训练方法-> 量化粒度-> 敏感层策略-> 推理引擎-> 硬件 kernel-> 真实任务评估你的模型瓶颈是权重、激活、KV cache 还是算力?你的目标硬件支持什么低精度 kernel?你的任务能容忍多少质量回退?你的评估集是否覆盖真实长尾输入?量化后是否真的降低 p95 延迟和单位请求成本?一句话收束:好的量化不是把模型压到最低比特,而是在目标硬件上用最小质量代价换到可验

我们介绍了DeepSeek-V3.2,这是一个在高效计算与卓越推理及智能体性能之间取得平衡的模型。DeepSeek-V3.2的关键技术突破如下:(1) DeepSeek稀疏注意力(DSA):我们引入了DSA,这是一种高效注意力机制,在保持长上下文场景中模型性能的同时,大幅降低了计算复杂度。(2) 可扩展的强化学习框架:通过实施稳健的强化学习协议并扩展后训练计算,DeepSeek-V3.2的表现与G

通用推理能力长期以来一直是人工智能领域的一项艰巨挑战。最近的突破,例如大语言模型(LLMs)(Brown et al., 2020;OpenAI, 2023)和思维链(CoT)提示(Wei et al., 2022b),在基础推理任务上取得了相当大的成功。然而,这种成功在很大程度上依赖于大量的人工标注演示,并且模型的能力对于更复杂的问题仍然不足。本文中,我们展示了大语言模型的推理能力可以通过纯强化
物体计数是计算机视觉中的一项基本任务,在许多现实世界场景中具有广泛的适用性。全监督计数方法需要每个物体昂贵的点级标注。少数弱监督方法仅利用图像级物体计数作为监督,并取得了相当有希望的结果。然而,它们通常仅限于计数单一类别,例如人。在本文中,我们提出了 WS-COC,这是第一个由多模态大语言模型(MLLM)驱动的弱监督类无关物体计数框架。
遮挡是人群计数中的根本挑战之一。研究界已经提出了多种数据驱动方法来处理这一问题,但效果仍然有限。主要原因在于,大多数现有人群计数数据集基于被动相机采集,训练在这些数据集上的方法难以充分感知环境。近年来,具身导航方法在交互式场景中的精确目标检测方面展现出显著潜力。这些方法采用主动相机设置,有望解决人群计数中的根本问题。然而,现有大多数方法是为室内导航设计的,在大规模场景中分析复杂目标分布(例如人群)

目录说明CPUGPUASICFPGA说明本文参考:https://mp.weixin.qq.com/s/i7g9ApGi2Z8H9xI4JvqO6w,这边篇文章对常用的AI芯片做了比较客观的分析,我截取了部分内容,以便收藏备用。最常见的四种芯片是CPU、GPU、ASIC、FPGA。五个维度是算力也就是芯片的性能、灵活性、同构性、成本和功耗。首先就是算力,也就是芯片的性能。这里的性能有很多方面,比如
倒置瓶颈(Inverted Bottleneck),最初由MobileNetV2[25, 54]提出,因其轻量级计算和简单性而成为许多最新先进模型[62, 63, 18, 65, 43, 38, 69]的精髓。在FLOP计算方面,要实现超越深度可分离卷积的效果水平是复杂的。逐点卷积解决了缺少通道间相关性的问题,这是无法回避的难题。然而,在我们的倒置瓶颈块实验中,我们观察到优化通道数可以有效地减少计

https://www.mdpi.com/2072-4292/17/14/2421针对复杂场景和密集分布的小目标,在无人机图像的小目标检测场景中,这经常导致严重的误检和漏检。因此,我们提出了一种无人机图像小目标检测算法,命名为SMA-YOLO。首先,在骨干网络中集成了一个无参的简单切片卷积模块,对特征图进行切片和增强,以有效保留小目标的特征。随后,为了增强上下层之间的信息交换,我们设计了一个特殊的

航拍视角目标检测是自然资源监测、交通管理和无人机搜救等现实应用中的一项关键技术。在高分辨率航拍图像中检测微小目标一直是一个长期存在的挑战,原因在于其有限的视觉线索以及在复杂场景中建模全局上下文的困难。现有方法常常受到上下文融合延迟和非线性建模不足的阻碍,无法有效利用全局信息来优化浅层特征,从而遭遇性能瓶颈。为了解决这些挑战,我们提出了,一种用于航拍视角目标检测的新型框架,其核心是频域解耦融合。首先

YOLO 系列等单阶段目标检测器在实时视觉应用中实现了最先进的性能,但其训练仍严重依赖大规模标注数据集。本文系统研究了对比自监督学习(Self-Supervised Learning, SSL)作为一种减少该依赖性的手段,通过在未标注图像上使用 SimCLR 框架对 YOLOv5 和 YOLOv8 的骨干网络进行预训练。我们提出了一种简单而有效的流程:将 YOLO 的卷积骨干网络作为编码器,采用全








