logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

spark从入门到放弃四十:hive on spark

知识背景(1)hive是目前大数据领域,事实上的sql标准。其底层默认是基于MapReduce实现的,但是由于MapReduce速度不够快。因此近几年,陆续出来了新的Sql查询引擎。包括Spark Sql,hive on tez,hiveon spark.SparkSql和hiveon spark是不一样的。sparksql是Spark自...

#spark#大数据#hive
Semaphore 信号量限流 ,这东西真管用吗

最近参与公司的服务治理项目,主要目的是为了保证生产服务高可用性,以及高稳定性。为了更好的参与的这个项目,这段时间一直在充电学习这方面的相关知识,包括限流,熔断,服务降级等等。那在学习限流的时候,看到网上很多文章中直接使用了JDK 中 Semaphore 实现了限流器。虽然到达的限流的目的,但是实际上其还是存在很大缺陷。那你如果没有经过完整测试,直接将这套限流方式照搬过来,发到了生产环境,那就等着背

spark从入门到放弃十五:master 主备切换

文章地址:http://www.haha174.top/article/details/254300Master实际上可以配置两个,那么Spark原生的standalone模式是支持Master主备切换的。也就是说,当Active Master节点挂掉时,可以将StandBy master节点切换为Active Master。Spark Master主备切换可以基于两种机制,一种是...

#spark#zookeeper
Spring Boot学习之旅:(五)Spring Boot 使用 junit 单元测试

最近刚好时间写了一些关于SpringBoot的帖子,正好现在把Junit再拿出来从几个方面再说一下。那么先简单说一下为什么要写测试用例1. 可以避免测试点的遗漏,为了更好的进行测试,可以提高测试效率2. 可以自动测试,可以在项目打包前进行测试校验3. 可以及时发现因为修改代码导致新的问题的出现,并及时解决那么本文从以下几点来说明怎么使用Junit,Junit4比3要方便很多,细节大家

spark sql on yarn 启动失败 ERROR client.TransportClient: Failed to send RPC RPC

19/04/17 02:54:57 ERROR client.TransportClient: Failed to send RPC RPC 7651764253676103503 to /10.169.12.139:45996: java.nio.channels.ClosedChannelExceptionjava.nio.channels.ClosedChannelException...

#yarn
spark2.0原理源码解析(二) : spark submit 脚本解析

从上一篇文章中我们得知 spark-shell 实际上调用的是 spark-submit 脚本本篇来看下 spark submit 脚本实现。if [ -z "${SPARK_HOME}" ]; thensource "$(dirname "$0")"/find-spark-homefi# disable randomized hash

hadoop namenode启动过程

NameNode启动过程详细剖析1. FSImageNamenode会将HDFS的文件和目录元数据存储在一个叫fsimage的二进制文件中,每次保存fsimage之后到下次保存之间的所有hdfs操作,将会记录在editlog文件中,当editlog达到一定的大小(bytes,由fs.checkpoint.size参数定义)或从上次保存过后一定时间段过后(sec,由fs.checkpoint.p..

spark 大型项目实战(四十一):算子调优之使用repartition解决Spark SQL低并行度的性能问题

并行度:之前说过,并行度是自己可以调节,或者说是设置的。1、spark.default.parallelism2、textFile(),传入第二个参数,指定partition数量(比较少用)咱们的项目代码中,没有设置并行度,实际上,在生产环境中,是最好自己设置一下的。官网有推荐的设置方式,你的spark-submit脚本中,会指定你的application总共要启动多少个executo...

spark 大型项目实战(二十六): --性能调优之在实际项目中分配更多资源

分配更多资源:性能调优的王道,就是增加和分配更多的资源,性能和速度上的提升,是显而易见的;基本上,在一定范围之内,增加资源与性能的提升,是成正比的;写完了一个复杂的spark作业之后,进行性能调优的时候,首先第一步,我觉得,就是要来调节最优的资源配置;在这个基础之上,如果说你的spark作业,能够分配的资源达到了你的能力范围的顶端之后,无法再分配更多的资源了,公司资源有限;那么才是考虑去做后面的这

#spark
spark 大型项目实战(九):用户访问session分析(九) --开发JDBC辅助组件(连接池)

项目源码:https://github.com/haha174/spark-session-project.git在第八篇文章中介绍到了单例模式首先我们使用单例模式创建一个连接池保存程序初始启动时获取的链接信息如下// 为什么要实现代理化呢?因为它的内部要封装一个简单的内部的数据库连接池// 为了保证数据库连接池有且仅有一份,所以就通过单例的方式// 保证JDB...

#spark
    共 26 条
  • 1
  • 2
  • 3
  • 请选择