
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文针对YOLOv8sDET目标检测模型提出三版递进式轻量化优化方案:第一版通过输入分辨率压缩(1024→512)实现48.2%参数量降低和18.2%算力优化,检出率保持99.62%;第二版精简C2f模块迭代层数,参数量累计压缩58.2%,算力降低21.3%,检出率99.61%;第三版采用GhostConv替换标准卷积,在参数量减少10.2%、算力降低7.7%的同时,检出率提升至99.75%。实验
本文全面解析了传统Vision Transformer(ViT)模型,该模型由Google团队2020年提出,首次将纯Transformer架构应用于计算机视觉任务,打破了CNN在视觉领域十余年的统治地位。文章从背景、原理到实现详细介绍了ViT的创新设计:通过图像分块(Patch Embedding)、添加分类令牌(Class Token)和可学习位置编码,将二维图像适配Transformer的序

摘要: sherpa-kws是sherpa-onnx框架中的关键词检测(KWS)功能,用于本地化语音唤醒与指令识别(如“开灯/关灯”)。其核心为小型流式ASR模型,通过限制解码范围仅响应预设关键词(需转换为拼音token),并支持动态调整触发阈值(keywords_threshold)与灵敏度(keywords_score)。配置步骤包括:安装依赖、下载中文模型(如wenetspeech-3.3M

DeepSeek团队推出的两代OCR模型(2025版DeepSeek-OCR和2026版DeepSeek-OCR2)通过创新技术解决了传统OCR在复杂文档处理中的核心痛点。初代模型采用上下文光学压缩技术,将高分辨率图像压缩为极少量视觉令牌,显著降低算力需求;二代模型引入视觉因果流架构,模拟人类阅读逻辑,实现自适应令牌分配和语义化理解。两代模型在保持超高压缩比(最低64个令牌)的同时,识别精度全面领

国内外研究现状(综述)

本文针对YOLOv8sDET目标检测模型提出三版递进式轻量化优化方案:第一版通过输入分辨率压缩(1024→512)实现48.2%参数量降低和18.2%算力优化,检出率保持99.62%;第二版精简C2f模块迭代层数,参数量累计压缩58.2%,算力降低21.3%,检出率99.61%;第三版采用GhostConv替换标准卷积,在参数量减少10.2%、算力降低7.7%的同时,检出率提升至99.75%。实验
随着人工智能的兴起,身份识别以及行为识别开始逐渐发展起来了,其中特征提取就是十分关键的一步。特征提取分为传统特征提取和深度特征提取,本章着重介绍了传统特征提取。传统特征提取一般提取的是边缘特征、 角特征、颜色特征以及纹理特征等具体特征,具有提取特征具体化、提取速度快、提取效果好等优势。传统特征提取主要有Harris、SIFT、SURF、LBF、HOG、DPM、ORB等方法,这些方法各有各的优势,具

本文全面解析了传统Vision Transformer(ViT)模型,该模型由Google团队2020年提出,首次将纯Transformer架构应用于计算机视觉任务,打破了CNN在视觉领域十余年的统治地位。文章从背景、原理到实现详细介绍了ViT的创新设计:通过图像分块(Patch Embedding)、添加分类令牌(Class Token)和可学习位置编码,将二维图像适配Transformer的序

DeepSeek团队推出的两代OCR模型(2025版DeepSeek-OCR和2026版DeepSeek-OCR2)通过创新技术解决了传统OCR在复杂文档处理中的核心痛点。初代模型采用上下文光学压缩技术,将高分辨率图像压缩为极少量视觉令牌,显著降低算力需求;二代模型引入视觉因果流架构,模拟人类阅读逻辑,实现自适应令牌分配和语义化理解。两代模型在保持超高压缩比(最低64个令牌)的同时,识别精度全面领

本文针对YOLOv8sDET目标检测模型提出三版递进式轻量化优化方案:第一版通过输入分辨率压缩(1024→512)实现48.2%参数量降低和18.2%算力优化,检出率保持99.62%;第二版精简C2f模块迭代层数,参数量累计压缩58.2%,算力降低21.3%,检出率99.61%;第三版采用GhostConv替换标准卷积,在参数量减少10.2%、算力降低7.7%的同时,检出率提升至99.75%。实验







