
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
之前可以使用穷举的方法逐个测试找使损失函数最小的点(即找最优权重),但权重过多时,会使穷举变得非常困难,因此需要优化,梯度下降法就是其中一种优化方式。要找到最小值的点,可以让点沿着下降最快的方向移动,梯度的负方向(即负的cost对w的导数)就是下降最快的方向,w随之更新。梯度下降并行度更好,时间复杂度低,但是性能较差。(实话讲这里没听懂老师说的原因,只知道结论了,先记录下来)图中公式的α值代表学习

在PyTorch中,torch.Tensor类是存储和变换数据的重要工具,相比于Numpy,Tensor提供GPU计算和自动求梯度等更多功能,在深度学习中,我们经常需要对函数求梯度(gradient)。里面包含两个比较重要的成员data(比如权重值)和grad(损失函数对权重的导数)有两个重要的成员,一个是data(保存权重w),一个是grad(保存损失函数对权重的导数)。对于简单的模型,梯度变换

1.准备数据集 dataset和dataloader 2.设计模型 3.构造损失函数和优化器4.训练过程前馈(算损失)、反馈(算梯度)、更新(用梯度下降更新)

在PyTorch中,torch.Tensor类是存储和变换数据的重要工具,相比于Numpy,Tensor提供GPU计算和自动求梯度等更多功能,在深度学习中,我们经常需要对函数求梯度(gradient)。里面包含两个比较重要的成员data(比如权重值)和grad(损失函数对权重的导数)有两个重要的成员,一个是data(保存权重w),一个是grad(保存损失函数对权重的导数)。对于简单的模型,梯度变换

评价类问题,充分利用原始数据的信息,精确反应各个评价方案之间的差距。公式不唯一公式不唯一(但我也没想到更好的)不唯一不唯一,这只是前人论文中用的较多的一种标准化方法。未完待续…...
当需要多分类的时候,会输出一个分布,这些分布需要满足`P(y = i) >=0 和 所有的P值加起来=1`,使用softmax可以实现。







