机器学习中经典算法的归纳
一、概念
1.1什么是“有监督学习”?
简单来说,有监督学习就是“有标准答案的学习”。
我们给机器的训练数据里,既要有“问题”(特征X),又有“标准答案”(标签Y)。机器通过不断对比自己的预测和正确答案之间的差距,逐步学会从X推导出Y的规律。
有监督学习包含两类任务:分类问题和回归问题。
1.2什么是“无监督学习”?
无监督学习就是“没有标准答案的自主探索”。
训练数据里只有“问题”(特征X),没有任何标签(Y)。机器根本不知道这些数据是什么,只能自己去发现数据内部隐藏的结构和规律。
无监督学习的典型任务:聚类。
聚类,就是在没有任何标准答案(没有标签)的情况下,让机器根据数据之间的“相似度”,自动把相似的东西归成一个个“小团体”(即簇)。
二、7大算法的归类
(1)KNN(K近邻):看离你最近的K个邻居是啥样,分类时投票,回归时取平均。
监督方式:有监督。主要用途是用于分类和回归。
(2)线性回归:画一条直线(或超平面)来拟合数据,预测连续数值,比如房价。
监督方式:有监督。主要用途是用于回归。
(3)逻辑回归:通过概率阈值强行输出“是/否”的离散类别,所以本质上是分类算法
监督方式:有监督。主要用途是用于分类。
(4)决策树:通过层层“是/否”或“多选”判断把复杂数据逐级拆分成纯净子集,最终在叶子节点给出分类或回归结论。
监督方式:有监督。主要用途是用于分类和回归。
(5)随机森林:多棵决策树组成的“森林”,投票决定最终结果,比单棵树更稳定。
监督方式:有监督。主要用途是用于分类和回归
(6)朴素贝叶斯:根据每个特征出现的概率各自“投票”,用贝叶斯定理算出总概率,最终把结果判给概率最高的那个类别。
监督方式:有监督。主要用途是用于分类。
(7)K-means(K均值):它不做分类也不做回归。在没有标签的情况下,自动把数据“分堆”。
监督方式:无监督。
记住:算法各有各的优缺点,选择适合你的数据和业务场景。
更多推荐
所有评论(0)