logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

多模态-10 Qwen-VL

本文介绍了千问系列的多模态模型Qwen-VL,重点阐述了Qwen-VL的创新架构和训练方法。该模型采用ViT图像编码器、视觉-语言适配器和Qwen7B语言模型的组合结构,通过[img]、[box]、[ref]等特殊标记实现图像特征与文本的语义对齐。模型训练分为预训练、多任务预训练和监督微调三个阶段,支持中英双语理解、图像定位和OCR等任务。Qwen-VL通过创新的标记机制和分阶段训练策略,在多个评

文章图片
#多模态
多模态-11 Qwen2-VL

Qwen2-VL是Qwen-VL的升级版多模态模型,主要改进包括:支持任意分辨率图像输入、扩展视频处理能力、增加多语言支持(日语、韩语等8种语言)以及提升视觉任务范围。模型结构由视觉编码器和语言大模型组成,采用2D-RoPE和M-RoPE技术处理时空信息。训练采用三阶段方法,使用包含1.4T token的高质量多模态数据集。Qwen2-VL提供2B、8B和72B三种参数规模版本,适用于不同应用场景

文章图片
#多模态
异常检测Anomalib库使用说明

摘要: Anomalib是Intel开源的一站式深度学习异常检测库,支持图像、视频、3D点云等多模态异常检测,集成25+种SOTA算法。基于PyTorch/PyTorch Lightning构建,提供统一的数据加载、模型训练、推理及可视化流程,内置MVTec等15+标准数据集支持,并支持自定义数据集。核心功能包括自动化模型训练/验证、OpenVINO/ONNX加速、超参数优化及低代码Web应用(A

大模型应用开发-Langchain(V1-最新版)-中

本文介绍了大模型应用开发中LangChain框架的关键技术,重点讲解了检索器和记忆系统两大核心功能。在检索器部分,详细阐述了文档嵌入与向量存储的实现方法,包括普通检索、检索器融合、上下文压缩、元信息查询、父文档回溯和多维度检索等多种检索策略,并提供了Python代码示例。在记忆系统部分,介绍了基础会话记忆、带上下文裁剪记忆、摘要式记忆、RAG增强记忆和知识图谱记忆五种记忆机制,展示了如何有效管理和

文章图片
大模型应用开发-Langchain(V1-最新版)-下

本文介绍了LangChain最新版(V1)在大模型应用开发中的核心功能与实现方法。主要内容包括:1) 工具调用机制,详细讲解@tool装饰器、StructuredTool和BaseTool三种工具封装方式;2) Agent构建方案,重点介绍基于LangGraph的工作流实现和传统Prompt方式构建ReAct智能体;3) 回调处理机制,对比事件流和handler函数两种回调方式。文章通过完整代码示

文章图片
计算机视觉-Backbone超详细整理(下)-Transformer时代

本文系统梳理了计算机视觉中Transformer架构Backbone的发展历程。文章首先将深度学习模型归纳为四大架构:前馈神经网络、卷积神经网络、循环神经网络和Transformer,重点解析了Transformer的多头注意力机制原理。2021年是Transformer在CV领域的突破之年,ViT通过图像分块策略首次将Transformer成功应用于视觉任务,CLIP开创了多模态对比学习范式,S

#计算机视觉#transformer#人工智能
计算机视觉Transformer-2 目标检测

本文系统介绍了基于Transformer的目标检测模型发展历程。首先分析DETR如何通过集合预测思想替代传统CNN检测方法,详细解析其Encoder特征编码和Decoder目标解码机制,以及匈牙利算法实现的损失计算。随后探讨Deformable DETR的两大改进:可分离注意力机制降低计算复杂度,多尺度特征融合提升小目标检测效果。最后介绍RT-DETR的创新设计,包括两阶段查询机制、高层特征注意力

文章图片
#计算机视觉#transformer#目标检测
具身智能-VLA综述

摘要: 《ASurveyonVision-Language-ActionModelsforEmbodiedAI》系统综述了具身智能(EmbodiedAI)中的视觉-语言-动作(VLA)模型。具身智能需通过物理载体(如机器人、自动驾驶汽车)与环境交互,被视为实现通用人工智能(AGI)的关键路径。传统强化学习方法面临泛化性差、数据效率低等问题,而VLA模型通过融合视觉(V)、语言(L)输入直接生成动作

具身智能-VLA综述

摘要: 《ASurveyonVision-Language-ActionModelsforEmbodiedAI》系统综述了具身智能(EmbodiedAI)中的视觉-语言-动作(VLA)模型。具身智能需通过物理载体(如机器人、自动驾驶汽车)与环境交互,被视为实现通用人工智能(AGI)的关键路径。传统强化学习方法面临泛化性差、数据效率低等问题,而VLA模型通过融合视觉(V)、语言(L)输入直接生成动作

计算机视觉-Backbone超详细整理(下)-Transformer时代

本文系统梳理了计算机视觉中Transformer架构Backbone的发展历程。文章首先将深度学习模型归纳为四大架构:前馈神经网络、卷积神经网络、循环神经网络和Transformer,重点解析了Transformer的多头注意力机制原理。2021年是Transformer在CV领域的突破之年,ViT通过图像分块策略首次将Transformer成功应用于视觉任务,CLIP开创了多模态对比学习范式,S

#计算机视觉#transformer#人工智能
    共 35 条
  • 1
  • 2
  • 3
  • 4
  • 请选择