
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
对比维度多层感知机 (MLP)卷积神经网络 (CNN)适用数据结构化数据、特征向量、表格数据网格结构数据:图像、视频、语音频谱等连接方式全连接(每个神经元与上层所有神经元相连)局部连接(神经元仅连接局部感受野)参数共享无,每个连接有独立权重卷积核在整个空间位置共享,大幅减少参数特征提取需要人工特征或原始特征自动学习层次化空间特征平移等变性无(依赖训练样本分布)卷积操作天然具有平移等变性参数量示例输
计算输出层误差从后向前逐层传播误差:池化层:上采样误差图卷积层:卷积转置操作传播误差更新权重:输入激活值。
Transformer 是 NLP 领域的里程碑模型核心是注意力机制(Q、K、V)广泛应用于机器翻译、文本生成、视觉大模型等领域W%5EO%20b_2。
提出:Google团队,2020年CVPR论文《An Image Is Worth 16x16 Words》。核心思想:将图像划分为多个patch,当作“词”输入Transformer。ViT将图像视为patch序列,借鉴NLP中的Transformer架构。CLIP结合图像和文本,扩展了视觉模型的应用边界。DINO通过知识蒸馏实现高效的视觉自监督学习。视觉大模型的发展,本质上是NLP思想向视觉领
对比维度多层感知机 (MLP)卷积神经网络 (CNN)适用数据结构化数据、特征向量、表格数据网格结构数据:图像、视频、语音频谱等连接方式全连接(每个神经元与上层所有神经元相连)局部连接(神经元仅连接局部感受野)参数共享无,每个连接有独立权重卷积核在整个空间位置共享,大幅减少参数特征提取需要人工特征或原始特征自动学习层次化空间特征平移等变性无(依赖训练样本分布)卷积操作天然具有平移等变性参数量示例输
计算输出层误差从后向前逐层传播误差:池化层:上采样误差图卷积层:卷积转置操作传播误差更新权重:输入激活值。
Transformer 是 NLP 领域的里程碑模型核心是注意力机制(Q、K、V)广泛应用于机器翻译、文本生成、视觉大模型等领域W%5EO%20b_2。
提出:Google团队,2020年CVPR论文《An Image Is Worth 16x16 Words》。核心思想:将图像划分为多个patch,当作“词”输入Transformer。ViT将图像视为patch序列,借鉴NLP中的Transformer架构。CLIP结合图像和文本,扩展了视觉模型的应用边界。DINO通过知识蒸馏实现高效的视觉自监督学习。视觉大模型的发展,本质上是NLP思想向视觉领
小白学习DLC过程记录








