《机器学习》周志华笔记——第一章绪论
·
#《机器学习》笔记
第一章绪论
数据集:分为训练集,测试集,比例8:2,7:3
-
训练集(training set):用来训练模型的数据集
-
测试集(testing set):用来测试模型的数据集
-
样本(sample):一行数据就是一个样本;多个样本组成数据集;有时候一条样本被称为一条记录(一个西瓜)
-
特征(feature):一列数据是一个特征,有时也被称为属性
- 特征是从数据中抽取出来的,对结果预测有用的信息
- 比如西瓜的色泽与形状
-
标签(label)/目标(target):模型要预测的哪一列数据(想要的答案——输出变量)
泛化能力:模型适用于新样本的能力
奥卡姆剃刀原则:给定两个具有相同泛化误差的模型,较简单的模型比较复杂的模型更可取
分类:预测值为离散值
回归:预测值为连续值
有监督学习:输入的训练数据是有标签的
有监督学习的两类算法:
-
分类问题:目标值(标签值)是不连续的
- 分类种类:二分类,多分类
- 从一小批可能的输出中预测出类别
-
回归问题:目标值(标签值)是连续的
- 从无数数据中预测出具体数值
无监督学习:训练数据没有标签
- 样本数据类别未知,没有标签
- 根据样本间的相似性,对样本聚集类,以发现事务内部结构与相互关系
更多推荐
所有评论(0)