
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
1 项目背景随着移动设备的完善和普及,移动互联网+各行各业进入了高速发展阶段,这其中以O2O(Online to Offline)消费最为吸引眼球。据不完全统计,O20行业估值上亿的创业公司至少有10家,也不乏百亿巨头的身影。O2O行业关联数亿消费者,各类APP每天记录了超过百亿条用户行为和位置记录,因而成为大数据科研和商业化运营的最佳结合点之一。以优惠券盘活老用户或吸引新客户进店消费是O2O的一

目录1.背景2.分析目标3.数据准备4.数据清洗4.1查看是否含有缺失值4.2查看是否有异常值4.3数据整理5.具体目标分析5.1分析每年销售额的增长率5.2各个地区分店的销售额5.3销售淡旺季分析5.4新老客户数5.5用户价值度RFM模型分析6.案例结论6.1结论依据6.2案例结论1.背景随着电商的不断发展,网上购物变得越来越流行。更多电商平台崛起,对于电商卖家来说增加的不只是人们越来越高的需求

第11章 时间序列时间序列数据在很多领域都是重要的结构化数据形式,例如金融、经济、生态学、神经科学和物理学。在多个时间点观测或测量的数据形成了时间序列。许多时间序列是固定频率的,也就是说数据是根据相同的规则定期出现的,例如每15秒、每5分钟或每月1次。时间序列也可以是不规则的,没有固定的时间单位或单位间的偏移量。最简单和最广泛使用的时间序列是那些由时间戳索引的。11.1 日期和时间数据的类型及工具
#线性回归模型优缺点:#优点:快速;没有调节参数;可轻易解释;容易理解#缺点:相比较于其他复杂模型,其准确率不高,因为它假设特征和响应之间存在确定的线性关系,这种假设对于非线性的关系,不能得到合适的解决方法#实例import pandas as pddata = pd.read_csv('Advertising.csv')#使用pandas构建X(特征向量)和 y(标签列)#创建特征列表featu
第7章 数据清洗与准备7.1处理缺失值对于数值型数据,pandas使用浮点值NaN(Not a Number来表示缺失值)。我们称NaN为容易检测到的标识值:在pandas中,我们采用了R语言中的编程惯例,将缺失值成为NA,意思是not available(不可用)。在统计学应用中,NA数据可以是不存在的数据或者是存在但不可观察的数据(例如在数据收集过程中出现了问题)。当清洗数据用于分析时,对缺失
第12章 高阶pandas12.1 分类数据本节介绍pandas的Categorical类型。12.1.1 背景和目标一个列经常会包含重复值,这些重复值是一个小型的不同值的集合。我们已经看见向unique和value_counts这样的函数,它们允许我们从一个数组中提取不同值并分别计算这些不同值的频率:许多数据系统(用于数据入库、统计计算或其他用途)已经开发出专门的方法,用重复的值来表示数据,以便
目录1.背景2.分析目标3.数据准备4.数据清洗4.1查看是否含有缺失值4.2查看是否有异常值4.3数据整理5.具体目标分析5.1分析每年销售额的增长率5.2各个地区分店的销售额5.3销售淡旺季分析5.4新老客户数5.5用户价值度RFM模型分析6.案例结论6.1结论依据6.2案例结论1.背景随着电商的不断发展,网上购物变得越来越流行。更多电商平台崛起,对于电商卖家来说增加的不只是人们越来越高的需求

第12章 高阶pandas12.1 分类数据本节介绍pandas的Categorical类型。12.1.1 背景和目标一个列经常会包含重复值,这些重复值是一个小型的不同值的集合。我们已经看见向unique和value_counts这样的函数,它们允许我们从一个数组中提取不同值并分别计算这些不同值的频率:许多数据系统(用于数据入库、统计计算或其他用途)已经开发出专门的方法,用重复的值来表示数据,以便







