数据集划分,偏差与方差(吴恩达深度学习笔记)
·
目录
1.训练过程
(1)确定超参数
- 隐藏层数
- 每层神经元数
- 学习率
- 激活函数选择
(2)迭代改善
2.数据集
(1)创建高质量的数据集(有利于提高训练效率)
-
一般会将数据集分为三部分
训练集(training set):训练模型
验证集(development set):用于选择最优模型
测试集(test set):评估模型 -
对于数据量较小的(100~10000):数据集划分一般为训练集(60%),验证集(20%),测试集(20%)
-
对于数据量大的(百万级):一般训练集(98%),验证集(1%),测试集(1%)
(2)确保验证集和测试集分布(来源)一致,能提高训练效率
3.偏差与方差
- 偏差:bias,针对训练集的误差
- 方差:variance,针对训练集误差与验证集误差之间的差距
(1)定义
-
一个分类的例子

-
注意:下面的误差是针对理想误差(可以看成人的误差)来说的,下面定义中的理想误差看成0%
high bias(高偏差)(欠拟合):模型对训练集的误差就已经很大(10%以上),说明是高偏差
just right(好的):
high variance(高方差)(过拟合):通过训练集误差和验证集误差的对比,如果差距过大(比如训练集误差1%,而验证集误差11%),那就说明过拟合(训练的模型过分针对训练集)了,泛化性不好。 -
其他例子
理想误差0%的情况下:
训练集误差15%,验证机误差16% ->欠拟合(高偏差)
训练集误差15%,验证集误差30% ->欠拟合+过拟合(高偏差+高方差)(部分数据欠拟合,部分数据过拟合)
注意:如果理想误差比较大,比如是15%,那第一个例子就是很好的分类器,第二个只是高方差
(2)减小偏差和方差的方法
- 减小偏差:
一般增加神经网络深度和节点数就可以 - 减小方差:
增加数据
正则化
更多推荐
所有评论(0)