logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

YOLOv13 注意力机制

🚀【YOLOv13优化大全】最新模块实测效果汇总!包含20+种创新模块,覆盖注意力机制、轻量化设计、多尺度融合等方向,平均mAP提升5-15%: 核心模块:EMA、RVB、MSBlock等轻量模块实现计算量不变指标提升 注意力机制:TripletAttention、GAM等创新设计带来3-12%mAP增益 多尺度优化:CSP_MutilScale系列模块显著增强小目标检测能力 结构创新:Pool

文章图片
#深度学习#人工智能#计算机视觉
手把手教你玩转多模态ViT:从零理解视觉Transformer架构与跨模态注意力机制全流程(保姆级·小白友好·附疑难解答)

不妨从一个实际场景入手,比如用它来检索本地相册中与你描述相符的照片,或生成你想象中的艺术作品——当你看到模型能精准理解图文信息并给出反馈时,你会发现多模态AI的魅力所在。替换为你的测试图像,运行脚本后,模型会输出图像与各文本描述的相似度,你可以看到模型能精准匹配“一只猫”这个描述。准备一个包含多种图像的目录,运行脚本后,模型会根据文本“一只在草地上玩耍的狗”检索出最匹配的图像并展示。只需输入文本描

#transformer#深度学习#人工智能
YOLO26 电动车识别:公共场所违停检测系统

YOLO26s 电动车检测链路:800 张标注 → 增强 (hsv+mosaic+mixup+夜间) → 150 epoch → mAP@0.5=0.91 → ONNX (4.1M) → PyQt5 界面 + 违停分析 + Flask API。核心贡献:夜间数据 + CLAHE 预处理使暗光 recall 从 72% 提至 82%;违停分析用 pointPolygonTest 实现区域判定。建议先

文章图片
#知识图谱
多模态 ViT 模型从入门到实战:视觉 Transformer 的图文理解应用

CLIP 代表的多模态 ViT 方案让"看图说话"和"以文搜图"变成了零样本推理——不需要针对每个新场景重新训练模型,只需要写好对应的自然语言描述。如果需要在特定领域(如工业缺陷、医疗影像)取得更好的效果,可以用少量领域内图文对做 few-shot 微调。建议先用 ViT-B/32 验证在目标场景上的零样本准确率是否达到基线要求,再决定是否需要更大规格的模型或领域微调。

#transformer#深度学习#人工智能
从零构建人脸识别系统:Qt + 百度 AI 实战

Qt 负责界面和交互,百度 AI 提供人脸识别能力——这个组合使得在不具备机器学习背景的情况下,也能构建出功能完整的人脸识别系统。项目的技术栈(C++ GUI + RESTful API + JSON 解析)是 AI 应用开发的标准模式,可以复用到文字识别、图像搜索、语音合成等其他场景。建议先将整套链路跑通再逐层优化。

#qt#百度#人工智能
YOLO-World 多模态开放词汇目标检测实战

YOLO-World 用文本编码器替换了固定的分类头,实现了开放词汇目标检测。S 模型在 T4 上可达 350 FPS,适合实时场景。零样本检测的精度取决于文本描述是否接近 CLIP 训练数据中的常见视觉概念——用英文、写完整描述、加场景上下文通常更稳定。如果零样本效果不够,拿少量目标域数据微调 50 个 epoch 即可显著提升。

#目标检测#人工智能
InternVL-2.5 多模态大模型实战入门

InternVL-2.5 的架构是 ViT 编码器 + MLP Projector + LLM,输入图像用<image>标记与文本 prompt 拼接。8B 模型在 4bit 量化后约 8GB 显存可用。多图输入时保持<image>标记顺序与 pixel_values 顺序一致即可。建议先用动态分辨率调低max_num(如 6)来测试速度-精度的平衡点,再决定是否开启完整分辨率。

#分类#数据挖掘#人工智能
CLIP 多模态图文理解:从原理到零样本分类实战

CLIP 让"零样本分类"和"自然语言检索"变成了成熟可用的技术——不再需要为每个新任务标注数据、训练模型,只需要写好文本描述。在工业缺陷分类、商品检索、内容审核等场景中有明确的落地价值。建议先用 ViT-B/32 在目标场景上测试零样本效果,确认可用性后,再根据精度要求决定是否换更大规格的模型或做领域微调。

#分类#数据挖掘#人工智能
科研也能自动化?手把手教你用大模型打造 Research Agent

创建task: "研究生成式AI对医疗行业的影响,包括应用场景、技术挑战、市场规模预测"sub_tasks:- "生成式AI医疗应用场景分类"- "关键技术挑战(数据隐私、模型准确性等)"- "2025-2030年市场规模预测及驱动因素"如果要研究“半导体行业趋势”这类垂直领域,需要对Agent进行定制化调整。从基础的Search-O1到专业化的MetaGPT Research Agent,我们已

#自动化#运维
YOLOv11-Pose部署RK3588实战:人体姿态识别精度翻倍,边缘推理速度突破瓶颈

本教程从YOLOv11-pose模型的姿态识别训练,到RK3588的边缘量化部署,为你打造了一套“高精度+高实时性+低成本”的人体姿态分析解决方案。无论是健身动作纠正、智能安防行为检测,还是工业人员姿态监控,这套技术都能直接复用——你只需替换数据集与业务逻辑,即可快速落地专属的边缘AI姿态识别系统。如果你在实践中遇到任何卡点,欢迎随时交流。记住,人体姿态识别的价值在于“关键点准、推理快、部署易”,

    共 13 条
  • 1
  • 2
  • 请选择