
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
正向把数据算过去得出误差,反向利用链式法则把误差传回来求出梯度,最后用梯度下降法更新参数。
如果说上一周的 BP 算法是神经网络的引擎,那么这周的 CNN 就是神经网络的眼睛。理解了卷积和池化的底层逻辑,就能明白为什么深度学习在视觉领域能取得如此惊人的突破。
2017 年,Google 发表了一篇论文《Attention Is All You Need》,论文的标题言简意赅——你只需要注意力机制就够了。这篇论文提出的 Transformer 架构,彻底改变了 NLP(自然语言处理)领域的格局。在 Transformer 之前,处理序列数据(比如一句话)主要靠RNN/LSTM。它们的问题是什么?一个字一个字串行处理,不能并行计算,速度慢;而且句子一长,前
上篇我们学 Transformer 时,它的输入是「一个句子 = 一串单词」,每个词对应一个向量。这个套路对文本天然适用。但图像怎么办?图像是一个三维矩阵(宽 × 高 × 通道),没法直接喂给 Transformer。怎么把一张图片变成 Transformer 能消化的「一串向量」?把图切成小方块,每个方块当成一个“单词”。这就是 ViT 的核心思想。听起来简单,但 2020 年 Google 提
上篇我们学 Transformer 时,它的输入是「一个句子 = 一串单词」,每个词对应一个向量。这个套路对文本天然适用。但图像怎么办?图像是一个三维矩阵(宽 × 高 × 通道),没法直接喂给 Transformer。怎么把一张图片变成 Transformer 能消化的「一串向量」?把图切成小方块,每个方块当成一个“单词”。这就是 ViT 的核心思想。听起来简单,但 2020 年 Google 提







