logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

python数据分析与挖掘实战 之笔记2

《python数据分析与挖掘实战》学习笔记2经过前面章节的分析,即对数据进行探索和预处理,得到了处理后的数据。根据所得到的数据建立分类与预测、聚类分析、关联规则、时序模式、和偏差检测等模型,提取数据中蕴含的有价值的信息。下面就将对这部分知识做大致的介绍。1、分类与预测1.1 回归分析本小节只对二分类Logistic回归模型的相关原理进行介绍:(1)该模型的因变量只有0-1两个取值,...

#数据挖掘#数据分析#聚类
Windows10:spark报错。WARN Utils: Service ‘SparkUI‘ could not bind on port 4040. Attempting port 4041.

最近在单机练习SPARK的过程中,遇到下面的问题:本机:Windows10主要问题是:我之前打开了一个shell窗口,用Scala模式运行。然后在里面设置了spark的context,此时spark-shell里已经有一个context对象了,所以在pyspark中我新建创建的数据无法使用。解决方法:关闭之前打开的spark-shell.这里我采用的是ctrl+c,退出该程序命令。...

#spark
Windows10:spark报错。WARN Utils: Service ‘SparkUI‘ could not bind on port 4040. Attempting port 4041.

最近在单机练习SPARK的过程中,遇到下面的问题:本机:Windows10主要问题是:我之前打开了一个shell窗口,用Scala模式运行。然后在里面设置了spark的context,此时spark-shell里已经有一个context对象了,所以在pyspark中我新建创建的数据无法使用。解决方法:关闭之前打开的spark-shell.这里我采用的是ctrl+c,退出该程序命令。...

#spark
统计案例分析之预测社会消费品零售总额

本次分析主要是基于《统计学案例与分析》中4.2节的案例数据进行分析,其主要是关于社会消费品零售总额的预测。数据来源于国家统计局公布的2002-2007年的月度数据,运用适当的预测方法,预测2008年各月份的社会消费品零售总额。首先对于这个时间序列数据,我们需要先对其进行平稳性检验和纯随机性检验,即绘制时序图或自相关图进行检验;其次在建立相应的模型,判断模型的误差率;用该模型进行预测。以下操作先..

到底了