
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
初学机器学习
数据标准化是非常有必要的,因为各个数据的单位都不一样,这样会导致数据里有的列的值非常大,有的列的值非常小,在计算欧式距离时,数值大的则会占巨大权重,这样算出来的距离主要都由数值大的特征决定,非常不合理。那么这么多的样本数据怎么找到最近的K个数据呢?是用两点之间的距离来决定的,K近邻就是指离新样本距离最近的k个数据,欧氏距离公式。1.分类问题:要给新来的一个样本数据分类,看他周围最近的k个已知样本数
初学机器学习2 线性回归与逻辑回归
还是这个坐标轴,不过数据的分布如上图所示,我现在想要做一个分类,我找到一条直线将数据划分为上下两部分,将上半部分的数据标记为1,下半部分的数据标记为0,现在来了一个新数据,判断这个数据属于0还是1,这就是逻辑回归。在用Sigmoid函数压缩成概率下有这么个情况,当z趋于正无穷,p趋于1,这个p可直接当作概率,而当z趋于负无穷,p趋于0,这个p不能直接当作概率,要用(1-p)当作概率。正则化就是在极
初学机器学习4 K折交叉验证
平常我们在训练模型时对数据集是如何处理的呢,我们是这样做的,引入sklearn中的train_test_split模块,将数据集划分为训练集和测试集,再用训练集的数据拟合模型,最后用测试集验证模型的性能,根据返回的指标判断这个模型够不够好,不够好的情况下调试模型的参数,再去验证,如此多试几次得到一个较好的模型。可这样问题就出现了,你是怎么得到这个较好的模型的,你这个调试参数的行为是不是相当于把测试
到底了







