一、概念

1.1什么是“有监督学习”?

简单来说,有监督学习就是“有标准答案的学习”。

我们给机器的训练数据里,既要有“问题”(特征X),又有“标准答案”(标签Y)。机器通过不断对比自己的预测和正确答案之间的差距,逐步学会从X推导出Y的规律。

有监督学习包含两类任务:分类问题和回归问题。

1.2什么是“无监督学习”?

无监督学习就是“没有标准答案的自主探索”。

训练数据里只有“问题”(特征X),没有任何标签(Y)。机器根本不知道这些数据是什么,只能自己去发现数据内部隐藏的结构和规律。

无监督学习的典型任务:聚类。

聚类,就是在没有任何标准答案(没有标签)的情况下,让机器根据数据之间的“相似度”,自动把相似的东西归成一个个“小团体”(即簇)。

二、7大算法的归类

(1)KNN(K近邻):看离你最近的K个邻居是啥样,分类时投票,回归时取平均。

监督方式:有监督。主要用途是用于分类回归。

(2)线性回归:画一条直线(或超平面)来拟合数据,预测连续数值,比如房价。

监督方式:有监督。主要用途是用于回归。

(3)逻辑回归:通过概率阈值强行输出“是/否”的离散类别,所以本质上是分类算法

监督方式:有监督。主要用途是用于分类。

(4)决策树:通过层层“是/否”或“多选”判断把复杂数据逐级拆分成纯净子集,最终在叶子节点给出分类或回归结论。

监督方式:有监督。主要用途是用于分类回归。

(5)随机森林:多棵决策树组成的“森林”,投票决定最终结果,比单棵树更稳定。

监督方式:有监督。主要用途是用于分类回归

(6)朴素贝叶斯:根据每个特征出现的概率各自“投票”,用贝叶斯定理算出总概率,最终把结果判给概率最高的那个类别。

监督方式:有监督。主要用途是用于分类。

(7)K-means(K均值)它不做分类也不做回归。在没有标签的情况下,自动把数据“分堆”。

监督方式:无监督。

记住:算法各有各的优缺点,选择适合你的数据和业务场景。

更多推荐