logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

机器学习实验——KNN算法

当有一个不带标签的新数据进来时,KNN会把这个新数据的每一个特征,都和样本数据集中的数据一一比对,找出那些特征最像的“邻居”。最后,算法会看这k个最像的邻居里,哪个类别占比最多,就把这个类别作为新数据的分类结果。它的工作方式,是直接用训练数据把特征空间划分好,这个划分后的结果,就是它最终的模型。而KNN算法最终给出的结果,要么是这个点对应的类别标签,要么是一个具体的预测数值。KNN算法的优点很突出

#算法#机器学习
机器学习实验——后剪枝与预剪枝

首先不设置任何限制,生成一棵“枝叶茂密的满树”,然后从最底层的叶节点开始,向上遍历每一个非叶节点,判断如果把这个节点替换成叶节点,模型在验证集上的性能是否会提升(或者保持不变)。具体来说,就是在每个节点准备分裂之前,先进行判断:如果这次分裂不能提升模型的性能,或者已经满足了预先设定的停止条件,那么就直接把当前节点标记为叶节点,不再继续往下分裂。④在构建决策树的过程中,加入预剪枝的停止条件,比如最大

#机器学习#人工智能#剪枝
机器学习实验——决策树

因为整个判断过程会形成一个“根节点→中间节点→叶子节点”的树形结构(根节点是最初的判断条件,中间节点负责筛选中间特征,叶子节点就是最终的决策结果),所以才被叫做“决策树”。决策树的核心是由节点和有向边组成的:中间节点对应着数据的特征,叶子节点代表最终的类别,有向边则用来关联特征的具体取值。构建决策树的核心环节是挑选合适的特征,而“熵”这个概念,正是衡量数据混乱程度的重要标准,它能帮我们确定选择特征

#机器学习#决策树#人工智能
机器学习实验——贝叶斯

这个假设能极大降低计算的复杂度——原本计算P(X|Y)时,需要考虑所有特征结合在一起的联合概率,而有了特征独立的假设后,联合概率就可以拆分成每个特征对应条件概率的乘积,让计算变得简单可行。鸢尾花数据集的特征之间区分度较高,相互之间的关联性也比较低,比较好地满足了朴素贝叶斯“特征独立”的假设,再加上它的连续型特征与高斯分布的适配性很好,所以高斯朴素贝叶斯模型在这个数据集上表现得十分优异。它的基本思路

#机器学习#人工智能
机器学习实验——贝叶斯

这个假设能极大降低计算的复杂度——原本计算P(X|Y)时,需要考虑所有特征结合在一起的联合概率,而有了特征独立的假设后,联合概率就可以拆分成每个特征对应条件概率的乘积,让计算变得简单可行。鸢尾花数据集的特征之间区分度较高,相互之间的关联性也比较低,比较好地满足了朴素贝叶斯“特征独立”的假设,再加上它的连续型特征与高斯分布的适配性很好,所以高斯朴素贝叶斯模型在这个数据集上表现得十分优异。它的基本思路

#机器学习#人工智能
到底了