
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Join如何避免shuffle在我们使用Spark对数据进行处理的时候最让人头疼的就是业务上复杂的逻辑,而这些逻辑往往不是map算子就能解决的,不是aggragate就是join操作,而这些操作又伴随着shuffle极大地影响了程序执行过程的性能开销。今天我们来讨论下在使用join的时候如何避免shuffle的发生。一般我们直接使用join的时候都是触发commen join,这种join操作..
CatalogCatalog是一个抽象类,我们一般用它来对Spark里面的元数据进行操作的,其实现类是CatalogImpl这个类型我们一般使用catalog是在sparkSession的实例对象里调用的,将返回一个Catalog对象,使用这个对象就可以直接查看元数据了。val spark = SparkSession.builder().master("local[2]").
Flume简介Flume官网:http://flume.apache.org/从官网上我们可以知道,其实Flume是就是一种分布式,高可靠数据采集聚合与移动的服务。对于流式数据,其有这简单灵活的特性,支持容错横向扩张。如何体现Flume的简单灵活呢?Flume只有三中类型的组件,分别是:source,channel和sink。我们只需要写好配置文件在运行的时候指定我们的配置文件就可以了。so...
SparkSQL的基本了解SparkSQL是个啥?官网上都是怎么描述SparkSQL的官网地址:http://spark.apache.org/sql/我们先简单了解下官网是怎么描述SparkSQL这个东西的:Spark SQL is Apache Spark’s module for working with structured data.根据官网的描述就是Spark SQL这个东...
在我们使用Spark on Yarn的时候都会看到这样的一句:warning Neither spark.yarn.jars nor spark.yarn.archive is set, falling back to uploading libraries under SPARK_HOME.Ps:解释一下这幅图为什么这样啊,是因为我们内存不够了,所以才这样的,并不影响我们解决问题的既然提示...
我们之前都是使用sqoop把RBDMS的数据导入到HDFS里面,但并没有在hive里面同时构建表,现在我们需要将数据导入HDFS里面的同时为这批数据在hive里面构建表结构一般我们使用的命令:sqoop import --connect url --username root -P --table mysql里面的一个表(你也可以使用-e来给予SQL语句) --create-hive-...
Nginx入门什么是NginxNginx是一个HTTP和反向代理Web服务器,同时也提供IMAP/POP3/SMTP服务。其重点是一个反向代理服务器,那什么是反向代理服务器?首先,我们先来理解下正向代理服务器。当我们的client端向一个目标服务器发其请求的时候,我们的请求首先是要经过运营商的服务器,然后在由运营商的服务器来将我们的请求发送到我们的目标服务器上面(毕竟我们的网线并没有直接连接...
在idea上使用SparkSQL连接到Hive上将hive-site.xml存储到项目上的resources目录上既然我们要在idea上使用spark来访问Hive上的数据,那我们也要有元数据地址才行嘛,所以这和使用spark-sql访问一样需要hive-site.xml这个配置文件。我们将它放到项目的resources上面,记得要将这个文件夹标记成Resources哦。如果我们没有添加这个...







