
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
多模态大模型的视觉编码器通常被视为一个"黑盒"——图像进去,token 出来;但是当我们需要回答"为什么 Qwen2-VL 能处理任意分辨率的图像"或"它和 Swin Transformer V2 的本质差异在哪"等这样细致的问题,我们必须打开这个黑盒,追踪从像素到 token 的每一行代码;因此本文基于 Qwen2-VL 官方源码,将从数据流、核心模块、框架对比三个层面逐层拆解;

我们采用的大模型是 qwen3.5-9b ,是阿里 Qwen 团队开源的一款约 9B 参数的原生多模态大模型,既能处理文字,也能理解图片qwen3.5-9b,是一个具有 9b 参数的大模型,也就是 90 亿参数的大模型;这个大模型是已经具备有图片理解,文字识别的能力,因此我们是在一个具备学习能力的模型的基础上把它培养成一个更擅长某种任务的模型;模型的下载可以通过魔塔社区直接下载,权重所占内存大约是

因为这一块的代码注释确实是真的很详细,如果我再继续赘述确实显得比较无聊;我们可以看到一个简单的神经网络的脉络是比较简单的;希望大家可以做到手搓这样的卷积网络,难度不大的;我们在最后结果可以发现实际上这样的一个简单的网络参数量还是很多的,有兴趣的同学可以看看我之前主页的mapping net,这篇文章就是有少量的参数去逼近大参数的效果;AI筑基录的专栏会慢慢更新完,带大家有体系的理解神经网络的由来!

这一将的概念比较多,还是得花点时间记忆一下;实际上卷积的种类不止介绍的这个普通卷积;比如还有深度可分离卷积,分组卷积,空洞卷积等等内容;后面我们专栏AI筑基录也会慢慢推进这一些内容;有了前面几期的内容,我们下一期就是用 MNIST 数据集做一个简单的实战,我们用完整的神经网络做一个分类任务;浅浅期待一下;AI筑基录的专栏会慢慢更新完,带大家有体系的理解神经网络的由来!0+0+0








