
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
从几何方面思考向量,当遇到向量时,首先考虑一个箭头以及落在某个坐标系中,比如x-y平面,并且箭头起点为原点,这里和物理学角度的不同,向量可以在空间中如何位置落脚(起点),但是在线性代数中向量(通常以坐标系中的原点为起点)把每个向量看作一种特定的运动,及在空间中朝着某个方向迈出一定的,先按v的运动方式运动,然后按照w的运动方式运动,总体运动效果与沿着这两个向量的和运动无异。,等于将向量中的各个元素(
函数的类型、如何寻找函数、定义含未知参数的函数、定义一个损失函数(Loss)、优化 Optimization梯度下降 Gradient Descent

从几何方面思考向量,当遇到向量时,首先考虑一个箭头以及落在某个坐标系中,比如x-y平面,并且箭头起点为原点,这里和物理学角度的不同,向量可以在空间中如何位置落脚(起点),但是在线性代数中向量(通常以坐标系中的原点为起点)把每个向量看作一种特定的运动,及在空间中朝着某个方向迈出一定的,先按v的运动方式运动,然后按照w的运动方式运动,总体运动效果与沿着这两个向量的和运动无异。,等于将向量中的各个元素(
张量(Tensor)是深度学习和机器学习中一个非常基础且重要的概念。在数学上,张量可以被看作是向量和矩阵的泛化。简单来说,张量是一种,它可以表示标量(0维)、向量(1维)、矩阵(2维)以及更高维度的数据结构。

在没有平行运算的情况下,Small Batch比 Large Batch更有效率;在有平行运算的情况下,Small Batch与Large Batch运算时间没有太大差距,除非大的超出一定界限;在一个epoch时间内,Large Batch比Small Batch更快,Large Batch更有效率;Small Batch比较陡,Large Batch比较稳定;比较noisy的batch size

I 是self -attention 的input,一串vector;self-attention 的运作机制其实就是一连串的矩阵乘法。在这一系列矩阵中,只有矩阵W q , W k , W v 是未知的,是需要通过训练学习的参数。

张量(Tensor)是深度学习和机器学习中一个非常基础且重要的概念。在数学上,张量可以被看作是向量和矩阵的泛化。简单来说,张量是一种,它可以表示标量(0维)、向量(1维)、矩阵(2维)以及更高维度的数据结构。

在没有平行运算的情况下,Small Batch比 Large Batch更有效率;在有平行运算的情况下,Small Batch与Large Batch运算时间没有太大差距,除非大的超出一定界限;在一个epoch时间内,Large Batch比Small Batch更快,Large Batch更有效率;Small Batch比较陡,Large Batch比较稳定;比较noisy的batch size

训练集如果loss很低,但测试集loss高,且不太可能是mismatch的情况,说明很可能是过拟合。方法:validation 数据集划分(N-flod Cross法划分, “交叉验证”取平均值)介绍了当我们遇到模型效果(loss)不理想时,进行模型优化的分析方法和思路。训练集如果loss很低,但测试集loss高,则可以分析 训练集和测试集的区别。加了神经元,没有优化效果:加了神经元,训练集和测试

在没有平行运算的情况下,Small Batch比 Large Batch更有效率;在有平行运算的情况下,Small Batch与Large Batch运算时间没有太大差距,除非大的超出一定界限;在一个epoch时间内,Large Batch比Small Batch更快,Large Batch更有效率;Small Batch比较陡,Large Batch比较稳定;比较noisy的batch size








