logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【深度解析】多模态MoE模型训练策略:LLaVA-MoE与Kimi-VL

本文对比分析了两种多模态混合专家模型(MoE)的训练策略。LLaVA-MoE采用三阶段渐进式训练:1)视觉-语言对齐(冻结ViT和LLM,训练投影器);2)指令遵循能力训练(解冻LLM);3)MoE结构优化(训练路由器和专家)。Kimi-VL则采用四阶段训练:1)单独预训练ViT和LLM;2)图文理解训练;3)联合冷却;4)长内容扩展训练,特别强化了128K长文本和高分辨率图像处理能力。两种策略各

文章图片
#人工智能#机器学习#深度学习 +3
多模态MOE—理解类模型Qwen3-VL-Moe结构分析

摘要:Qwen3-VL是阿里推出的新一代多模态大模型,采用"DeepStack"架构与MoE技术结合,优化了长视频和高分辨率图像的推理效率。模型包含Vision Encoder、Projector和LLM三部分:Vision Encoder支持原生分辨率输入和动态token处理;Projector通过DeepStack策略将视觉信息注入LLM多层,增强细节理解;LLM部分提供M

文章图片
#transformer#人工智能#深度学习 +1
多模态理解类模型技术小结

多模态大模型(Multimodal Large Language Models, MLLMs)通过整合图像、文本、语音、视频等多种信息形式,实现跨模态的语义理解与生成能力。

文章图片
#多模态#人工智能
WeMM多模态大模型在MindIE-LLM框架上的迁移适配实践

WeMM 是 WeChatCV 推出的最新一代多模态大语言模型。WeMM 具备动态高分辨率图片下的中英双语对话能力,在多模态大语言模型的榜单中是百亿参数级别最强模型,整体测评结果(Avg Rank)位居第一梯队。本文记录了将WeMM多模态大模型适配到MindIE-LLM推理框架的完整过程,迁移过程中重点解决了模型结构分析、权重转换、Embedding融合和服务化对接等关键技术挑战。

文章图片
#人工智能#多模态#机器学习 +2
多层感知机(MLP):深度学习中的基础构建模块

本文将系统介绍 MLP 的结构原理、核心特性、典型应用场景,并结合昇腾 NPU 的硬件优势,探讨其在实际部署中的优化路径。

文章图片
#深度学习#人工智能
大模型FLOPs利用率_MFU计算方法与注意事项

MFU(Model Flop Utilization,模型浮点运算利用率)是衡量大模型训练 / 推理效率的核心指标,用于量化硬件(如 GPU)的浮点运算能力被模型实际利用的比例。其计算原理围绕 “理论最大算力” 与 “模型实际消耗算力” 的比值展开,直接反映了硬件资源的利用效率。在深度学习领域,评估模型的计算量通常涉及到多个指标,其中MACs(Multiply-Accumulate Operati

#昇腾AI大模型#昇腾AI解决方案#深度学习 +2
基于昇腾的多模态模型后训练性能优化实践

本文基于VeRL开源框架,针对Qwen3-VL-8B模型在Atlas 800T A2硬件平台上的GRPO后训练流程,系统性地开展性能瓶颈分析与优化,通过推理与训练双路径协同调优,实现端到端性能提升30%。

文章图片
#性能优化#人工智能
大模型FLOPs利用率_MFU计算方法与注意事项

MFU(Model Flop Utilization,模型浮点运算利用率)是衡量大模型训练 / 推理效率的核心指标,用于量化硬件(如 GPU)的浮点运算能力被模型实际利用的比例。其计算原理围绕 “理论最大算力” 与 “模型实际消耗算力” 的比值展开,直接反映了硬件资源的利用效率。在深度学习领域,评估模型的计算量通常涉及到多个指标,其中MACs(Multiply-Accumulate Operati

#昇腾AI大模型#昇腾AI解决方案#深度学习 +2
    共 38 条
  • 1
  • 2
  • 3
  • 4
  • 请选择