logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

RuntimeError: Error(s) in loading state_dict for BertModel: size mismatch for bert.embeddings.word_e

函数中,发现如下信息,貌似transformer在当前版本(4.45.0)只会搜索config.json,已经不再会匹配到bert_config.json文件了。后来将legal bert配置中的bert_config.json改为config.json后,模型成功运行。

文章图片
#bert#人工智能#深度学习
【PyTorch】刘二大人的Pytorch深度学习实践学习笔记

之前基于rule的系统是通过人工设定规则实现,到了传统的机器学习方法则是通过手动设计特征(如把一段语音变成向量),最后通过一个mapping函数对应到输出。表示学习则希望feature的提取也是通过学习的方法来得到(而不是手工获取),但是其中feature的提取和mapping映射是分开完成的。深度学习是一种端到端的(end2end)的算法

文章图片
#深度学习#pytorch
吴恩达机器学习笔记

机器学习分为监督学习和无监督学习、(强化学习)。监督学习(supervised learning)分为回归和分类问题。 无监督学习(unsupervised learning)有聚类、异常检测和降维三个应用。sigmoid函数对应,在最外层加入sigmoid函数(有点像激活函数),就是逻辑回归算法举例子,在cost function中加入额外式子作为新的cost function,会使得w3和w4

文章图片
#机器学习#人工智能
李宏毅机器学习笔记

m和sigma都考虑了过去所有的gradient。区别:momentum主要考虑方向sigma主要考虑大小momentus是为了增加历史运动的惯性,RMS是为了缓和步伐的大小,变得更平缓network弹性逐渐变小。receptive field + parameter share 即为 convolutional layer。使用卷积层的神经网络即为CNN。CNN有比较大的bias,但是是专门为影

文章图片
#pytorch#深度学习
【PyTorch】刘二大人的Pytorch深度学习实践学习笔记

之前基于rule的系统是通过人工设定规则实现,到了传统的机器学习方法则是通过手动设计特征(如把一段语音变成向量),最后通过一个mapping函数对应到输出。表示学习则希望feature的提取也是通过学习的方法来得到(而不是手工获取),但是其中feature的提取和mapping映射是分开完成的。深度学习是一种端到端的(end2end)的算法

文章图片
#深度学习#pytorch
李宏毅机器学习笔记

m和sigma都考虑了过去所有的gradient。区别:momentum主要考虑方向sigma主要考虑大小momentus是为了增加历史运动的惯性,RMS是为了缓和步伐的大小,变得更平缓network弹性逐渐变小。receptive field + parameter share 即为 convolutional layer。使用卷积层的神经网络即为CNN。CNN有比较大的bias,但是是专门为影

文章图片
#pytorch#深度学习
吴恩达机器学习笔记

机器学习分为监督学习和无监督学习、(强化学习)。监督学习(supervised learning)分为回归和分类问题。 无监督学习(unsupervised learning)有聚类、异常检测和降维三个应用。sigmoid函数对应,在最外层加入sigmoid函数(有点像激活函数),就是逻辑回归算法举例子,在cost function中加入额外式子作为新的cost function,会使得w3和w4

文章图片
#机器学习#人工智能
吴恩达机器学习笔记

机器学习分为监督学习和无监督学习、(强化学习)。监督学习(supervised learning)分为回归和分类问题。 无监督学习(unsupervised learning)有聚类、异常检测和降维三个应用。sigmoid函数对应,在最外层加入sigmoid函数(有点像激活函数),就是逻辑回归算法举例子,在cost function中加入额外式子作为新的cost function,会使得w3和w4

文章图片
#机器学习#人工智能
李宏毅机器学习笔记

m和sigma都考虑了过去所有的gradient。区别:momentum主要考虑方向sigma主要考虑大小momentus是为了增加历史运动的惯性,RMS是为了缓和步伐的大小,变得更平缓network弹性逐渐变小。receptive field + parameter share 即为 convolutional layer。使用卷积层的神经网络即为CNN。CNN有比较大的bias,但是是专门为影

文章图片
#pytorch#深度学习
到底了