最常用的机器学习算法包括:

  • 监督学习(用得更多)
  • 非监督学习

监督学习

监督学习的特点就是提供学习的正确例子,包括输入和对应的正确输出(也就是其对应的标签label)

大部分的监督学习都离不开两种主要类型:

        1.回归问题

        回归问题的特点就是预测数字,从无限种可能的数字中判断出一个答案。比如给一堆的(x,y),通过建立相关的线性或非线性回归模型,最后能够通过给的输入x来预测对应的y是什么。

        2.分类问题

        相比于回归问题需要从无限种可能的结果中得出一个答案,分类问题只需要从有限的几种类别中判断出一种。

非监督学习

非监督学习给的输入,不会包括其对应的标签。比如,给出每个肿瘤的大小、患者的年龄等等数据,但并不直接要求需要得到每组数据的肿瘤是良性还是恶性,而是让算法自己寻找这些数据中有着什么样的模型或者结构(就是自己找规律)

  • 聚类算法
  • 异常检测
  • 降维(在损失最少特征的前提下将庞大的数据集降维成更小更精华的数据集)

有一种特殊类型的无监督学习,称为聚类算法。比如Google News,每天收集成千上万的新闻,然后对新闻进行聚类学习,最终自动将新闻分成动物区、财经区、军事区。。。

线性回归

线性回归模型

损失函数

模型:f(x)=wx+b

平均平方误差:

这个是迄今为止,线性回归问题中最常用的损失函数计算公式

更多推荐