logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

[CLIP-VIT-L + Qwen] 多模态大模型源码阅读 - MultiModal篇

使用nn.Sequential创建一个顺序执行的深度网络块,nn,Linear为全连接线性层,第一个全连接层接受视觉模型的输入,将输入的维度转换为语言模型隐藏层维度的输出,经过一个激活函数GELU增加模型的非线性,经过另一个线性全连接层转换后输出。调用父类的to方法,传入*args, **kwargs参数,提高代码的可拓展性。假设传入的Input_ids的size为(1,5),利用语言模型生成结果

文章图片
#计算机视觉#nlp#人工智能 +4
[CLIP-VIT-L + Qwen] 多模态大模型源码阅读 - trainer篇

我们传入的model参数实际上是一个以Qwen为语言模型,SIGLIP/CLIP-VIT为视觉模型的多模态模型参数,所有这里的model.LLM大概率是语言模型,saved_params_llm获取语言模型微调后的adapter状态字典,并将其存储到输出路径下的adapter_model.bin文件中。其余的参数在后续都将应用权重衰减。如果设置了投影层的学习率,我们获取opt_model中所有名字

文章图片
#人工智能#计算机视觉#python +4
到底了