
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要: 一位机械专业转行计算机视觉的工程师,正在系统性地转向多模态大模型方向。他创建了GitHub仓库"From0to1-MLLM-StudyLog",每周记录学习内容(包括LLM基础、多模态框架、项目实践及部署技术),分享学习资源和实践心得。该仓库特别适合非科班出身、想转型大模型的学习者参考。作者鼓励同行者一起学习,通过持续记录实现渐进式转型。仓库地址:https://git
本文介绍了Transformer环境搭建与入门指南,包括文档手册获取、Hugging Face注册及模型下载方法。详细讲解了模型调参技巧,如max_new_tokens、top_p和temperature的设置原则与应用场景对比。最后分享了作者的多模态大模型学习日志GitHub仓库(From0to1-MLLM-StudyLog),包含从机械专业转型的实践经验、每周学习记录和部署demo,旨在为同样
这些模态编码器为MM-LLMs提供了处理和理解多种类型数据的能力,使得模型能够在多模态任务中有效地整合和利用来自不同源的信息。通过这些编码器,MM-LLMs能够更好地理解和生成与图像、视频、音频和3D数据相关的自然语言描述。这些输入投影器的设计旨在提高模型对多模态输入的理解能力,使得MM-LLMs能够在处理图像、视频、音频等非文本数据时,与文本数据进行有效的交互。通过这些投影器,模型能够将不同模态

本文介绍了参数高效微调(PEFT)的几种主流方法,包括LoRA、Prefix Tuning、P-Tuning、Prompt Tuning和IA³。LoRA通过低秩矩阵对线性层进行增量更新,Prefix Tuning在每层attention注入可学习前缀,P-Tuning在输入层或各层添加软提示,Prompt Tuning仅在输入层加入可学习向量,IA³则通过缩放因子调节中间激活。这些方法都能在不改
CV转多模态大模型,BLIP,BLIP2 Caption详解
CV转多模态大模型笔记,CLIP入门,图文检索
第六周结束,CLIP和BLIP系列模型告一段落,完成CLIP、BLIP、BLIP2、LORA原理、多模态SFT,Attention逐行拆解,qformer拆解,CLIP、BLIP、BLIP2的实现和微调。输出一个图像captain和文搜图的小demo。源码已更新:https://github.com/wz940216/From0to1-MLLM-StudyLog/

本篇是minillava系列的起始篇,week07开始将从零搭建一个mini的llava模型,本周我们先设计minillava的模型框架,下载必要的微调数据集,串好数据流,验证forward功能。并将参数配置到config.yaml中。
从零开始搭建了minillava中的三大组件,vision encoder,projector,llmdecoder。完善训练pipline。包括dataset、trainloop、infer三个部分。实现完整的minillava的训练和推理。
本文介绍了多模态大模型训练中多任务数据集的构建方法。主要内容包括:1) 将COCO Caption和VQA等不同格式的数据统一转换为LLaVA对话格式;2) 分析VQA数据集结构,包含问题、答案和图像ID的对应关系;3) 提出通过设置采样权重来平衡不同数据集的训练比例,在配置文件中指定各数据集路径、图像目录、标注文件和采样率。这种方法使模型能够同时训练多种任务数据,如描述生成、视觉问答等,提升多模







