
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
目录概述sklearn中的朴素贝叶斯高斯朴素贝叶斯概述算法得出的结论,永远不是100%确定的,更多的是判断出了一种“样本的标签更可能是某类的可能性”,而非一种“确定”。我们通过某些规定,比如说,在决策树的叶子节点上占比较多的标签,就是叶子节点上所有样本的标签,来强行让算法为我们返回一个固定结果。但许多时候,我们也希望能够理解算法判断出的可能性本身。每种算法使用不同的指标来衡量这种可能性。比如说,决
目录1 导入数据查看相关信息2 数据预处理2.1 去重复值+更新索引2.2 填补缺失值2.3 处理易操作2.4 划分训练集和测试集并保存3 分箱1 导入数据查看相关信息2 数据预处理2.1 去重复值+更新索引删除重复数据以后,索引依然是原来的数值,一定要记得更新为删除完重复数据之后的样本数量。2.2 填补缺失值查看缺失值比例针对于该数据,我们需要填充的是月收入和家属人数。家属人数缺失很少,仅缺
1.相关概念1.1 定义分类决策树模型是一种描述对实例进行分类的树形结构.决策树由结点(node)和有向边( directed edge)组成.结点有两种类型:内部结点(internal node)和叶结点(leaf node)、内部结点表示一个特征或属性,叶结点表示一个类。决策树的损失函数通常是正则化的极大似然函数。1.2 生成过程决策树的生成是一个递归过程.在决策树基本算法中,有三种情形会导致
相关概念支持向量机的分类方法,是在这组分布中找出一个超平面作为决策边界,使模型在数据上的分类误差尽量接近于小,尤其是在未知数据集上的分类误差(泛化误差)尽量小。边际很小的情况,是一种模型在训练集上表现很好,却在测试集上表现糟糕的情况,所以会“过拟合”。所以我们在找寻决策边界的时候,希望边际越大越好。支持向量机,就是通过找出边际最大的决策边界,来对数据进行分类的分类器。也因此,支持向量分类器又叫做最
1 基本概念数据预处理的目的:让数据适应模型,匹配模型的需求。特征工程是将原始数据转换为更能代表预测模型的潜在问题的特征的过程,可以通过挑选最相关的特征,提取特征以及创造特征来实现。其中创造特征又经常以降维算法的方式实现。可能面对的问题有:特征之间有相关性,特征和标签无关,特征太多或太小,或者干脆就无法表现出应有的数据现象或无法展示数据的真实面貌特征工程的目的:1) 降低计算成本,2) 提升模型上
目录pandas1.pandas的基础概念2.pandas和numpy的区别3.pandas的数据结构4.series相关操作5.DataFrame6.pandas读取外部数据7.pandas关于nan的处理pandas1.pandas的基础概念pandas,python+data+analysis的组合缩写,是python中基于numpy和matplotlib的第三方数据分析库,与后两者共同构成
目录数据预处理完整代码数据预处理导入数据查看相关信息在现实中,我们会先分训练集和测试集,再开始进行数据预处理。这是由于,测试集在现实中往往是不可获得的,或者被假设为是不可获得的,我们不希望我们建模的任何过程受到测试集数据的影响,否则的话,就相当于提前告诉了模型一部分预测的答案。完整代码import pandas as pdimport numpy as npimport sysimport ref
针对股票数据的项目分析实战目录针对股票数据的项目分析实战1.数据预处理2.调用to_dsv方法把数据保存到本地3.删除unnamed列4.找出所有收盘比开盘上涨超过3%的日期5. 找出所有收盘比开盘跌幅超过2%的日期6.估计收益7.计算均线8.统计金叉和死叉的时期1.数据预处理首先需要使用pip install tushare安装tushare第三方包, Tushare是一个免费、开源的pyth







