logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从零到一 | CV转多模态大模型 | week09 | Minillava Refactor结合手搓和llava源码深入理解多模态大模型原理

重新梳理llava的结构细节,从源码出发再次理解llava的核心原理。结合week08的简单实现,重构代码为更合理的结构,并在此过程中加深对llava模型的印象,补充一些细节上的知识点。

#机器学习#人工智能#深度学习 +2
从零到一 | CV转多模态大模型 | week13 |多模态数据集大一统——OpenAI Chat风格的三角色(system/user/assistant)消息格式

本文主要介绍了在多模态大语言模型(MLLM)训练中,如何将不同格式的数据(如caption、QA、VQA)统一转换为OpenAI Chat风格的三角色(system/user/assistant)消息格式,并进行训练的过程。

#计算机视觉#深度学习#人工智能 +2
从零到一 | CV转多模态大模型 | week14 | Mini-LLaVA多轮对话稳定性与JSON结构化输出控制

本周在 week13 的 OpenAI Chat 三角色对齐基础上,继续补齐 Mini-LLaVA 的多轮对话工程能力。主要包括四件事:推理侧增加历史轮数截断,训练侧增加轮次级和 token 级截断,针对 JSON 业务输出补充 few-shot prompt 模板,并封装 JSON 提取、校验和失败重试模块。最后通过固定多轮测试脚本,把每轮问题、回答、JSON 校验状态和截断后的 history

#人工智能#机器学习#改行学it +2
从零到一 | CV转多模态大模型 | week16 | 多模态大模型全流程训练过程

本文记录了minillava多模态大模型的三阶段微调实验:1)使用视觉描述和VQA数据对齐视觉语言模型,冻结视觉编码器和语言模型,训练投影层;2)用多模态指令数据微调投影层并添加LoRA适配器;3)采用DPO优化指令跟随能力。实验使用4张3090显卡进行分布式训练,实现了验证集监控和最优模型保存机制,通过选择性参数存储节省显存。作者将持续更新多模态大模型学习笔记,相关代码和配置已开源。该工作为多模

#计算机视觉#深度学习#人工智能 +2
从零到一 | CV转多模态大模型 | week17 | LLM 推理优化 & vLLM 详解

本文介绍了vLLM框架的核心原理与应用场景。vLLM是一个针对大语言模型推理优化的服务引擎,通过PagedAttention技术实现KV缓存的高效管理,采用类似操作系统分页的内存分配策略减少显存浪费。相比原生Transformers推理,vLLM支持动态批处理(continuous batching),能显著提升多并发场景下的吞吐量,特别适合长上下文、多采样和beam search等复杂推理任务。

#人工智能#机器学习#深度学习 +2
从零到一 | CV转多模态大模型 | week18 | Hugging Face风格转换,多模态大模型部署发版

本文总结了第16周训练的多模态大语言模型(MLLM)的整理与部署工作。原模型仅保存了project和LoRA参数,image encoder和LLM仍需加载官方权重,导致部署维护困难。本周通过将LoRA合并到基础LLM中,统一保存为Hugging Face标准格式model.safetensors,便于使用transformers库加载和vLLM服务部署。文章提供了模型转换脚本、配置定义及处理代码

#人工智能#机器学习#改行学it +2
从零到一 | CV转多模态大模型 | week19 | 基于 FastAPI 和 vLLM 的多模态大模型部署

本文介绍了一个基于FastAPI和vLLM的多模态HTTP服务架构设计。服务采用分层设计:FastAPI负责业务逻辑(图片上传、限流、日志等),vLLM专注模型推理。主要特点包括:1) 通过请求队列控制并发;2) IP级限流;3) 图片预处理;4) 业务与模型解耦,支持独立扩展。服务提供/chat接口接收图片和问题,返回模型响应,并支持通过环境变量配置各项参数。这种分层架构提高了系统的可维护性和扩

#fastapi#人工智能#计算机视觉 +2
从零到一 | CV转多模态大模型 | week17 | LLM 推理优化 & vLLM 详解

本文介绍了vLLM框架的核心原理与应用场景。vLLM是一个针对大语言模型推理优化的服务引擎,通过PagedAttention技术实现KV缓存的高效管理,采用类似操作系统分页的内存分配策略减少显存浪费。相比原生Transformers推理,vLLM支持动态批处理(continuous batching),能显著提升多并发场景下的吞吐量,特别适合长上下文、多采样和beam search等复杂推理任务。

#人工智能#机器学习#深度学习 +2
从零到一 | CV转多模态大模型 | week16 | 多模态大模型全流程训练过程

本文记录了minillava多模态大模型的三阶段微调实验:1)使用视觉描述和VQA数据对齐视觉语言模型,冻结视觉编码器和语言模型,训练投影层;2)用多模态指令数据微调投影层并添加LoRA适配器;3)采用DPO优化指令跟随能力。实验使用4张3090显卡进行分布式训练,实现了验证集监控和最优模型保存机制,通过选择性参数存储节省显存。作者将持续更新多模态大模型学习笔记,相关代码和配置已开源。该工作为多模

#计算机视觉#深度学习#人工智能 +2
从零到一 | CV转多模态大模型 | week12 | 整理 MiniLLaVA 工程与文档

本周重点是将前几周的实验代码整理成更接近开源工程的形态,包括清晰的目录结构、明确的入口、可复用的配置和可追踪的日志。主要内容包括:1) 工程目录结构整理为code、configs、utils、outputs四个核心目录;本周重点不是继续堆模型能力,而是把前面几周的实验代码整理成更接近开源工程的形态:目录清楚、入口明确、配置可复用、日志可追踪、文档能让别人快速跑起来。这些配置把模型大小、任务组合、日

#人工智能#深度学习#计算机视觉 +2
    共 26 条
  • 1
  • 2
  • 3
  • 请选择