注:此文章内容均节选自充电了么创始人,CEO兼CTO陈敬雷老师的新书《GPT多模态大模型与AI Agent智能体》(跟我一起学人工智能)【陈敬雷编著】【清华大学出版社】

清华《GPT多模态大模型与AI Agent智能体》书籍配套视频课程【陈敬雷】

GPT多模态大模型与AI Agent智能体系列一百六十八

多模态大模型卷出新高度!LLaVA-1.5 凭 LoRA 微调 + 高分辨率输入,11 项任务登顶 SOTA

7.4开源端到端训练多模态大模型LLaVA
在人工智能领域,多模态大模型正以前所未有的速度推动着人机交互、内容生成和理解的边界。其中,LLaVA系列模型以其强大的多模态处理能力和开源特性,成为了这一领域的明星。从LLaVA的基础版本,到其不断演化的迭代如LLaVA1.5、LLaVA1.6,再到混合专家模型MoE-LLaVA,以及LLaVA-Plus和面向视频处理的Video-LLaVA和LLaVA-NeXT-Video系列,每一版都在原有基础上进行了突破性的创新和优化。
7.5.1 LLaVA
在多模态人工智能领域,LLaVA(Large Language and Vision Assistant)标志着一个重要的里程碑。作为一个端到端训练的大型多模态模型,LLaVA巧妙地融合了视觉编码器和大语言模型,开创了一种全新的视觉和语言理解范式。LLaVA开源地址是https://github.com/haotian-liu/LLaVA,目前已经17K+星,具有很高热度及活跃度。
1.LLaVA的核心设计与贡献
LLaVA的设计灵感源自对指令遵循大型多模态模型(Instruction-following LMM)的深入研究,这类模型通常由预训练的视觉主干网络、大语言模型以及视觉语言跨模态连接器构成。LLaVA的创新之处在于,它通过两阶段训练法——视觉语言对齐预训练与视觉指令调整——实现了视觉特征与语言词嵌入空间的有效对齐,从而确保模型能准确理解和执行复杂的视觉指令。LLaVA的一个核心贡献是创建了大规模的多模态指令跟随数据集。面对缺乏高质量视觉语言指令数据集的挑战,研究团队利用ChatGPT和GPT-4将COCO数据集中的图像文本对转化为适用于指令跟随的格式。这一过程产生了涵盖对话式问答、详细描述与复杂推理三种类型的丰富数据,共计158K个样本,为模型训练提供了坚实的基础。
2.模型架构
在模型架构方面,LLaVA采用了CLIP的开放集视觉编码器与LLaMA语言解码器相结合的方式,通过一个简洁的线性层将视觉特征无缝映射至语言模型的词嵌入空间。这种设计不仅简化了模型结构,还显著提高了模型在多模态任务上的表现力。此外,LLaVA的开源策略,包括多模态指令数据、训练代码、模型权重和可视化工具,极大地促进了学术界和工业界的交流与合作。
3.训练策略与数据构造
LLaVA的训练流程分为两个阶段:首先,通过微调线性层来对齐视觉特征与语言嵌入;随后,仅冻结视觉编码器,继续微调语言模型和线性层,以增强模型对视觉指令的理解能力。值得注意的是,训练数据的构造巧妙地利用了GPT-4的能力,将COCO数据集中的Caption和Bounding boxes信息转化为对话、详细描述和复杂推理三类指令跟随数据,每类数据都精心设计,以覆盖不同的认知和推理层次。
5.应用与效果分析
在实际应用中,LLaVA展现了卓越的图像理解能力,能够准确识别图像内容、回答相关问题,并进行深度推理。特别是在OCR和KIE任务中,LLaVA能够高效地从图像中提取文字信息和结构化知识,展现出与传统单一模态方法截然不同的优势。LLaVA及其系列模型通过一系列技术创新,包括多模态指令数据的构建、高效模型架构的设计以及精细化的训练策略,为多模态人工智能的研究树立了新标杆。
7.5.2 LLaVA1.5
LLaVA-1.5是一个多模态视觉-文本大语言模型,它在多个方面进行了优化和改进,包括改进Vision-Language连接器、探讨不同方面的缩放影响、改进模型的回答格式、增加多层感知器(Multilayer Perceptron,MLP)视觉-语言连接器、添加特定任务的数据集等。这些优化使得LLaVA-1.5在12个任务中的11个上达到了最新的技术水平(State of the Art,SOTA),即便其预训练和指令调优的数据相对较少。LLaVA-1.5模型改进如下:
(1)明确指定输出格式的提示:为了解决短文本VQA(Visual Question Answering)和长文本VQA之间的兼容问题,研究者在短文本回答中明确指定了输出格式的提示。例如,通过在问题文本的末尾添加特定的短语,如“Q: {问题} A: {答案}。”,模型能够基于用户的指示适当地调整输出格式。
(2)使用MLP作为视觉-语言连接器:受到自监督学习性能提升的启发,研究者使用了两层MLP作为视觉-语言连接器,以增强连接器的表达能力。这一改进相较于原始的线性投影架构,显著提升了LLaVA的多模态能力。
(3)模型结构:LLaVA-1.5基于CLIP的视觉编码器和LLaMA语言解码器,使用最简单的两层FC构成MLP(LLaVA是一层)映射视觉特征到文本长度。
(4)添加特定任务的数据集:为了强化模型在不同能力上的表现,研究者不仅添加了VQA数据集,还专注于OCR和区域级别识别的四个数据集。这些数据集包括需要广泛知识的VQA(如OKVQA和A-OKVQA)、需要OCR的VQA(如OCR-VQA和TextCaps)等。
(5)视觉编码器:使用更高分辨率图像输入,从而可能捕获更多的细节和上下文信息。
(6)微调策略:引入LoRA微调,降低微调的计算成本,同时保持了模型的泛化能力。
(7)性能提升:在多个基准测试中达到了新的技术水平,尤其是在需要短格式回答的测试中取得了更好的成绩。
架构更加简单的LLaVA-1.5只需要120万公开数据,即可超越用了15.5亿训练数据的Qwen-VL和1.3亿数据的HuggingFace IDEFICS。其中,13B模型的训练,只需要8个A100就可以在1天内完成。LLaVA-1.5由浙江大学校友团队开发,并在Github上开源。提供了7B和13B两种规模的模型,以满足不同用户的需求。

更多技术内容

更多技术内容可参见
清华《GPT多模态大模型与AI Agent智能体》书籍配套视频【陈敬雷】
更多的技术交流和探讨也欢迎加我个人微信chenjinglei66。

总结

此文章有对应的配套新书教材和视频:

【配套新书教材】
《GPT多模态大模型与AI Agent智能体》(跟我一起学人工智能)【陈敬雷编著】【清华大学出版社】
新书特色:《GPT多模态大模型与AI Agent智能体》(跟我一起学人工智能)是一本2025年清华大学出版社出版的图书,作者是陈敬雷,本书深入探讨了GPT多模态大模型与AI Agent智能体的技术原理及其在企业中的应用落地。
全书共8章,从大模型技术原理切入,逐步深入大模型训练及微调,还介绍了众多国内外主流大模型。LangChain技术、RAG检索增强生成、多模态大模型等均有深入讲解。对AI Agent智能体,从定义、原理到主流框架也都进行了深入讲解。在企业应用落地方面,本书提供了丰富的案例分析,如基于大模型的对话式推荐系统、多模态搜索、NL2SQL数据即席查询、智能客服对话机器人、多模态数字人,以及多模态具身智能等。这些案例不仅展示了大模型技术的实际应用,也为读者提供了宝贵的实践经验。
本书适合对大模型、多模态技术及AI Agent感兴趣的读者阅读,也特别适合作为高等院校本科生和研究生的教材或参考书。书中内容丰富、系统,既有理论知识的深入讲解,也有大量的实践案例和代码示例,能够帮助学生在掌握理论知识的同时,培养实际操作能力和解决问题的能力。通过阅读本书,读者将能够更好地理解大模型技术的前沿发展,并将其应用于实际工作中,推动人工智能技术的进步和创新。

【配套视频】

清华《GPT多模态大模型与AI Agent智能体》书籍配套视频【陈敬雷】
视频特色: 前沿技术深度解析,把握行业脉搏

实战驱动,掌握大模型开发全流程

智能涌现与 AGI 前瞻,抢占技术高地

上一篇:《GPT多模态大模型与AI Agent智能体》系列一》大模型技术原理 - 大模型技术的起源、思想
下一篇:DeepSeek大模型技术系列五》DeepSeek大模型基础设施全解析:支撑万亿参数模型的幕后英雄

更多推荐