
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
3 Flume入门3.1 监控端口数据(官方案例)使用Flume监听一个端口,收集该端口数据,并打印到控制台。首先可以确定的是source用netcat;channel用memory;sink用logger步骤1:安装netcat工具sudo yum install -y nc步骤2:判断44444端口是否被占用sudo netstat -lnp | grep 44444步骤3:创建job文件夹,
Python数据可视化1 柱状图普通柱状图基本语法plt.bar(x, data, tick_label= , label= , bottom= , color= , width= )# x:所有柱子的下标列表,可以是list(range(5)),也可以是numpy.arange(5)数组# data:数据列表# tick_label:每个柱子标签列表,['G1', 'G2', 'G3', 'G4
6 Kafka监控eagle可以监控多套kafka集群,kafka通过jmx拉取数据。开启jmx拉取端口99996.1 安装配置eagle步骤1:修改kafka的启动命令sudo vim $KAFKA_HOME/bin/kafka-server-start.shif [ "x$KAFKA_HEAP_OPTS" = "x" ]; then# export KAFKA_HEAP_OPTS="-Xmx1
Python数据处理1 numpy数组操作numpy库概述是高性能科学计算和数据分析的基础包,支持维度数组、矩阵计算等ndarray概述N维数组对象ndarray,用来存放同类型元素的多维数组数组与矩阵的区别是:数组内的元素可以是字符等,而矩阵只能是数。创建数组import numpy as npa = [1, 2, 3, 4]b = np.array(a)print(a) #列表,元素间用逗号隔
5 hadoop3集群配置步骤1:配置nodepad++,可以在windows系统下修改linux内的文件。步骤2:集群规划hadoop102hadoop103hadoop104namenodesecondrynamenodedatanodedatanodedatanoderesourcemanagernodemanagernodemanagernodemanager步骤3:在hadoop102上
1 Spark内核概述Spark内核泛指Spark的核心运行机制,包括Spark核心组件的运行机制、Spark任务调度机制、Spark内存管理机制、Spark核心功能的运行原理。1.1 Spark核心组件(1)Yarn(RM & NM)(2)Spark(AM & Driver & Executor)①DriverSparK驱动器节点,用于执行Spark任务中的main方法,
Python数据可视化1 柱状图普通柱状图基本语法plt.bar(x, data, tick_label= , label= , bottom= , color= , width= )# x:所有柱子的下标列表,可以是list(range(5)),也可以是numpy.arange(5)数组# data:数据列表# tick_label:每个柱子标签列表,['G1', 'G2', 'G3', 'G4
1.1 DataX下载地址http://datax-opensource.oss-cn-hangzhou.aliyuncs.com/datax.tar.gz1.2 安装DataX步骤1:使用wget命令,采用阿里云地址下载[root@hadoop201 software]# wget http://datax-opensource.oss-cn-hangzhou.aliyuncs.com/data







