logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大数据工具——oozie调度

一、 基础命令#提交任务。-config是指定oozie任务的job.properties文件位置,submit是提交任务,每次提交任务后会把任务放到服务器并生产一个jobId,但是并不会运行这个任务oozie job -oozie http://namenode.com:11000/oozie -config /root/test1/job.properties -submit#执行该任务,00

#hadoop#big data#hdfs +2
大数据工具——Flume

一、Flume概念1.Flume介绍1、是一个分布式、可靠的、高可用的日志数据采集框架2、具有数据流的体系结构3、具有可调整的可靠性和容错性4、是Hadoop生态中的一个组件2.Flume设计1、Flume的最小运行单元是Agent,三大组件:Source,channel,Sink2、Flume在运行Agent时候,会占用JVM3、Flume组件Source:作用是与数据源进行交互,采集数据,封装

#flume#大数据#hadoop +1
大数据工具——Kylin

官网:http://kylin.apache.org/cn/官方文档http://kylin.apache.org/cn/docs/下载地址http://kylin.apache.org/cn/download/一、Kylin简介1.Kylin概念Kylin是一个分布式的数据仓库平台,可以将Hive中的数据同步到Kylin中进行数据分析,也可也实现多维立方体的查询,将最终结果保存到Hbase中。K

#数据仓库#数据库#大数据
大数据工具——Hive(基础)

一、HIVE的定义Hive是一个基于 Hadoop 的数据仓库工具,可以将结构化的数据文件映射成一张数据表,并可以使用类似SQL的方式来对数据文件进行读写以及管理。这套Hive SQL 简称HQL。Hive的执行引擎可以是MR、Spark、Tez。本质Hive的本质是将HQL转换成MapReduce任务,完成整个数据的分析查询,减少编写MapReduce的复杂度 。二、Hive的优缺点优点1.学习

#大数据#hadoop#hive +2
大数据工具——Hive(高级)

一、查询基本语法1.查询基本结构写顺序selectfromjoin ongroup byhavingorder bysort bylimitunion / union all执行顺序fromonjoinwheregroup byhavingselectdistinctorder bylimit查询注意事项尽量不要使用子查询、尽量不要使用 in not inselect * from aa1wher

#hive#hadoop#数据库
到底了