
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在上一篇文章中,介绍了多元线性回归,该模型一般只是用来衡量数值型变量间的线性关系,当解释变量或者被解释变量为分类型变量时,可能就不再适用,需要引入新的方法,比如设置虚拟变量和选择其它分类模型。接下来就介绍一个简单的二元选择模型——logit回归,此时被解释变量是分类变量,取值为0或者1。引例:信用风险识别,用logit模型对客户的违约行为进行预测。...
上次在用回归模型研究豆瓣短评top500的代表性时,爬了一份用户影视评分数据,今天结合协同过滤算法,做一个简易的“推荐系统”,将特定商品——影视作品推荐给潜在感兴趣的参与打分的用户。数据:包含24594条记录,涉及54部影视作品和19317算法与R语言包:协同过滤算法、recommenderlab具体步骤:数据预处理(主要是转化为稀疏矩阵)——推荐建模(topN;评分状况)+ 结果分析...
这是美团招聘数据分析的两道算法题:一、污水处理问题;二、棋盘颜色翻转。解决思路是R语言的循环与函数。一、【污水处理问题】一家污水处理厂通过去掉污水中有害的污物来净化水质,生产出用于灌溉使用的水源。该处理过程每小时可以去掉处理池中剩余污物的12%。问:1.一天后处理池中将大概处理掉百分之几的污物?2.要多长时间才能把污物的量减少一半?#1x<-0for (i in 1:24) ...
数据挖掘的一般流程:数据挖掘的基础:数据没有数据,谈何挖掘,巧妇难为无米之炊;没有相对有效的数据,模型再好,挖掘出来的信息也是无用的,Garbage in, Garbage out。数据分析并不要求数据完美,本来就有很多方法比如缺失值插补、Bootstrap抽样来应对这个问题,但是数据缺陷一定是有限度的。数据挖掘的目的:业务大多时候,做数据挖掘,不仅是玩数据而已,我们希望的是它能为实际...
基于B站视频数据,重温柯南TV版高人气剧集








