
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
对于变长序列,按序列长度排序后(不排序没法用PackedSequence),通过PackedSequence只存非0的维度,同时记住每个序列的非0项的长度(提高储存密度,提高计算速度),输入gru中。对于单向的循环神经网络,输出只考虑过去的信息(只有一个方向),而有些情景需要考虑未来的信息。最后输出tensor格式的seq_tensor、seq_lengths、countries。然后按序列长度从

RNN是一种专门用来处理带有序列模式的数据,如天气预测,文本处理等等(有上下文依赖关系)使用RNN,多一个参数num_layers,cell()的输出多一个out。全连接层的权重最多,卷积层的权重较少(共享权重)使用RNNCell把hello变成ohlol。只用一个RNNCell观察输入输出维度。常用解决办法:Embedding。且序列共享一个RNN cell。先把字母变成one-hot编码。RN

Residual net(ResNet)能解决梯度消失问题。他人实验表明并不是层数越多准确率越高。其中的一个Inception模块。1*1的卷积核可以有效减少计算。更为复杂的不是串行结构的模型。也大于1,能保留前面层的特征。GoogLeNet代码。如GoogLeNet。最后四个输出拼到一起。

使用pytorch框架后虽然比上次写的复杂一些,但是可以方便 扩展成更复杂的神经网。torch.nn.Linear :自动包含w和b。如torch.optim.SGD 自动帮你找到要更新的权重。用pytorch提供的工具实现线性模型训练过程。至少有两个方法_init_和forward。维度可以很大,但是loss必须是标量。3.设置loss函数和优化器,的维度,这样就知道w和b的维度。**kwarg

使用所有样本的Loss性能好但是时间复杂度高,使用平均样本loss则反之,于是折中每次使用一组(Mini-Batch)更新梯度。引入随机性,这样即使陷入到鞍点也能跨过鞍点,并且在训练大模型的时候也能加快训练速度。梯度下降(Gradient Descent),求偏导找往loss最小值去的方向。特殊点:鞍点(如马鞍),此时梯度=0(梯度消失),不再更新权值。是学习率也就是探索梯度的步长,太大会发散,太








