梯度下降

1.介绍

梯度下降的方式适用于所有函数最小化的问题,但是找到的是局部最小值

每一次都找下降J最快的方向走,但是实际情况中,可能会有很多极小值

每一步都同时更新W和b,计算公式如下:

这里有个细节,注意:

由于计算偏导的时候会用到旧的w和b,因此必须计算完tmp_w和tmp_b之后,再进行更新参数:w=tmp_w,b=tmp_b

2.学习率

如果学习率过小——梯度下降速度会很慢,需要很多很多步才能接近最小值;

如果学习率过大——步长太大又可能出现反复横跳的情况,最终可能无法收敛,甚至可能发散

如果刚开始就在极小值,导数为0,那J就会一直是那个值。

更多推荐