
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文分三个部分,首先是mac下搭建hadoop伪分布式集群,然后搭建eclispe下hadoop调试环境,最后配置hadoop源码,便于学习。Mac下Hadoop伪分布式搭建1. Hadoop下载源码包和编译后的包都要下载。这里我用的是hadoop-2.6.4,下载地址如下:https://archive.apache.org/dist/hadoop/common/hadoop-2.6.4/
spark java版本地(local模式)运行词频统计,WordCount
前言最初听闻word2vec还在读研了。当时挺感兴趣的,不过一直忙于毕业事项,没好好研究下,对word2vec也只是概念上的了解,直到这两天有空才能专门学习下这方面的知识。知识不经过整理很容易忘记,尤其像这种算法类的,一次性理解透彻~~至少对我这水平的来说还是比较困难,必须经过多个阶段学习才行,每个阶段都做好总结,这样有利于下个阶段的学习。本文主要从我的学习经历介绍下word2vec,还是以实践为
在数据挖掘中,原始海量的数据中存在着大量不完整、不一致、有异常、偏离点的数据。这些问题数据轻则影响数据挖掘执行效率,重则影响执行结果。因此数据预处理工作必不可少,而其中常见工作的就是数据集的缺失值处理。数据缺失值处理可分两类。一类是删除缺失数据,一类是进行数据插补。本文是对数据插补的介绍。
当前的分析对象是一段 timestamp-value 的时间序列,该时间序列可能是cpu使用率、磁盘使用率等数据。我们在计算前,首先需要判断的是什么样的值是异常值。基于移动平均的方法,其朴素思想是在直观上来看图形,认为近一段时间内的数据值,有着相似的走向趋势。因此判断一个值是否是异常值,可通过判断该值是否对数据趋势造成了破坏,来得出结论。
1. 背景最近项目中遇到求解时间序列相似性问题,这里序列也可以看成向量。在传统算法中,可以用余弦相似度和pearson相关系数来描述两个序列的相似度。但是时间序列比较特殊,可能存在两个问题:两段时间序列长度不同。如何求相似度?一个序列是另一个序列平移之后得到的。如何求相似距离?第一个问题,导致了根本不能用余弦相似度和pearson相关系数来求解相似。第二个问题,导致了也不能基于欧式距离...







