
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
[CLIP-VIT-L + Qwen] 多模态大模型源码阅读 - MultiModal篇
使用nn.Sequential创建一个顺序执行的深度网络块,nn,Linear为全连接线性层,第一个全连接层接受视觉模型的输入,将输入的维度转换为语言模型隐藏层维度的输出,经过一个激活函数GELU增加模型的非线性,经过另一个线性全连接层转换后输出。调用父类的to方法,传入*args, **kwargs参数,提高代码的可拓展性。假设传入的Input_ids的size为(1,5),利用语言模型生成结果

[CLIP-VIT-L + Qwen] 多模态大模型源码阅读 - trainer篇
我们传入的model参数实际上是一个以Qwen为语言模型,SIGLIP/CLIP-VIT为视觉模型的多模态模型参数,所有这里的model.LLM大概率是语言模型,saved_params_llm获取语言模型微调后的adapter状态字典,并将其存储到输出路径下的adapter_model.bin文件中。其余的参数在后续都将应用权重衰减。如果设置了投影层的学习率,我们获取opt_model中所有名字

到底了







