logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

hadoop2.7.3分布式集群问题汇总(持续更新)

hadoop2.7.3分布式集群问题汇总(持续更新)

#分布式#集群#大数据 +1
hadoop复习

hadoop复习

#hadoop
大数据采集的几点问题的思考

最近去面试,遇到面试官提到了几个关于“数据采集”方面的问题。一般大数据处理流程的共识是:大数据采集、大数据预处理、大数据存储及管理、大数据分析及挖掘、大数据展现和应用(大数据检索、大数据可视化、大数据应用、大数据安全等)。其中,数据采集是第一步。有这么几个情况:(1)日志类型的数据采集;(2)接口类型的数据采集;(3)爬虫数据采集;(4)传感器数据采集等等。。当然有别的分类,这里暂...

用ant自动compile|run|package spark程序

前段时间,需要写一个用户在前端编辑代码,后台自动生成scala程序的例子.其功能类似与web在线写代码,在线执行,出结果.一开始,不知从何下手,经同事提醒,可以用ant来自动编译程序,再结合sh脚本执行新的scala 编译后的程序.于是折腾了一天,写了一个build.xml编译工具:

#spark#scala
使用Apache atlas api创建血缘关系

使用Apache atlas api创建血缘关系

Apache atlas 的入门教程

笔者最近参加了2场大数据技术开放活动,在技术分享的时候,发现,2场分享活动,有人不约而同的推荐了Apache atlas 组件,所以,就像介绍一下这个组件。Apache atlas 是个什么样的工具?它有哪些功能和作用?其实,在本人之前的文章中有介绍,它是一个用在hadoop上的数据治理和元数据框架工具。它是基于hadoop平台上,能无缝对接hadoop平台的组件。前端UI默认使用solr5,..

#hadoop#大数据
到底了