#《机器学习》笔记

第一章绪论

数据集:分为训练集,测试集,比例8:2,7:3

  1. 训练集(training set):用来训练模型的数据集

  2. 测试集(testing set):用来测试模型的数据集

  3. 样本(sample):一行数据就是一个样本;多个样本组成数据集;有时候一条样本被称为一条记录(一个西瓜)

  4. 特征(feature):一列数据是一个特征,有时也被称为属性

    • 特征是从数据中抽取出来的,对结果预测有用的信息
    • 比如西瓜的色泽与形状
  5. 标签(label)/目标(target):模型要预测的哪一列数据(想要的答案——输出变量)

泛化能力:模型适用于新样本的能力

奥卡姆剃刀原则:给定两个具有相同泛化误差的模型,较简单的模型比较复杂的模型更可取

分类:预测值为离散值
回归:预测值为连续值

有监督学习:输入的训练数据是有标签的

有监督学习的两类算法

  • 分类问题:目标值(标签值)是不连续的

    • 分类种类:二分类,多分类
    • 从一小批可能的输出中预测出类别
  • 回归问题:目标值(标签值)是连续的

    • 从无数数据中预测出具体数值

无监督学习:训练数据没有标签

  • 样本数据类别未知,没有标签
  • 根据样本间的相似性,对样本聚集类,以发现事务内部结构与相互关系

更多推荐