今天看完了cs224n的lecture3,对前向传播、反向传播、神经网络的训练过程等加深了理解。

神经网络的训练过程:

取一批数据->前向传播->计算损失->反向传播->调整参数->前向传播...这样一个循环算一轮训练,一般需要训练多轮提升模型预测准确率,但是训练太多轮容易过拟合。

激活函数:

激活函数是神经网络中的核心组件之一,它的主要作用是引入非线性。如果没有激活函数,无论神经网络有多少层,最终都只能表示线性关系,这大大限制了模型的表达能力。

常见激活函数:

relu:负数->0,正数不变

sigmoid:压缩到0~1

损失函数:

损失函数是神经网络训练的核心组件之一,它的主要作用是衡量模型预测结果与真实标签之间的差距。如果没有损失函数,模型就没有优化目标,无法判断自己的预测是好是坏,更无法通过反向传播更新参数。

常见损失函数:

MSE(均方误差):常用于回归任务,计算预测值与真实值差的平方的平均值,误差越大,损失越大。

交叉熵损失(Cross-Entropy):常用于分类任务,衡量两个概率分布之间的差异,预测越接近真实分布,损失越小。

更多推荐