
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
·scala入门:基本语法(变量和数据类型、运算符、流程控制)·核心特性:函数式编程、面向对象、集合·其他特色:模式匹配、异常处理、隐式转换、泛型Spark—新一代内存级大数据计算框架,是大数据的重要内容。Spark就是使用Scala编写的。因此为了更好的学习Spark, 需要掌握Scala这门语言。Spark的兴起,带动Scala语言的发展在本机编辑高级环境中添加scala环境测试环境是否正确搭
外部系统的集成,即通过不同的生产端或消费端来实现数据消费过程。1、集成flumeflume是大数据开发者常用的组件,主要是高可用高可靠的日志系统,通过编写.conf文件来实现对日志文件的收集后转存到文件或hdfs集群的操作(离线日志文件)。可用于kafka的生产者,也可用于kafka的消费者。1)、flume作为生产端前期准备:启动kafka集群和zookeeperzk.sh startkf.sh
一、概念1、定义传统定义:Kafka是一个分布式的基于发布/订阅模式的消息队列(Message Queue),主要应用于大数据实时处理领域。主要任务:发布/订阅,消息发布者不会将消息发送给特定的订阅者,而是将发布的消息分为不同的类别(topic),由订阅者自己拉取感兴趣的消息。Kafka最 新定义 : Kafka是 一个开源的 分 布式事件流平台 (Event Streaming Platform
主要是通过在不同主机上建立多个NameNode,防止由于一台主机失去作用而导致集群失效,配置hadoop高可用,可以自动的使其他主机处于从standby转化为active状态
一、数据导入1、向表中装载数据(load)语法:load data [local] inpath '/opt/module/datas/student.txt' [overwrite] | into table student [partition (partcol1=val1,…)];(1)load data:表示加载数据(2)local:表示从本地加载数据到 hive 表;否则从 HDFS 加
1、概述zookeeper是一个开源的分布式的,为分布式框架提供协调服务的项目。从设计模式角度来理解:是一个基于观察者模式设计的分布式服务管理框架,负责存储和管理较为重要的数据,然后接受观察者的注册,一旦数据状态发生变化,zookeeper就将负责通知已经在zookeeper上注册的观察者(客户端)作出相同的反应。特点:zookeeper:一个领导者(leader),多个跟随者(follow)组成
一、复制和多路复用案例需求:使用 Flume-1 监控文件变动,Flume-1 将变动内容传递给 Flume-2,Flume-2 负责存储 到 HDFS。同时 Flume-1 将变动内容传递给 Flume-3,Flume-3 负责输出到 Local FileSystem。流程图如下:具体实现:...







