logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

kafka的ISR机制详解

在实际操作中,Kafka不会等待所有五个副本都确认消息后再认为消息已提交,ISR的做法是先设置几个队列(如设置3个,一般要为奇数个,不然zookeeper的过半选举机制容易难以进行),作为ISR队列,要求leader同步完这个两个才算完成,而其他的副本作为followers队列,不要求及时同步。这样做的好处就是如果leader端发生故障,可以及时从ISR队列中选出一个leader,因为他们是完全同

文章图片
#kafka#分布式
dolphinscheduler的spark环境变量踩坑记录

得知环境变量不能像官方模板一样配SPARK_HOME,而是要配SPARK_HOME1和SPARK_HOME2(取决于调度器运行时选择的spark版本),最终任务成功运行。尝试使用dolphinscheduler调度器跑spark任务时,一直报错spark,环境变量异常。

文章图片
#spark#大数据#分布式
实时计算框架梳理(flink,kafka,hbase/redis,clickhouse)

一旦监控到有数据产生,进入kafka服务器,并建立一个topic,开始了数据处理。这样的话,dws-sec中就会包含一些“未计算”的异常数据,这样就需要进行判断数据是否被计算过,没有计算过则需要重新计算,已经完成计算的不做处理,在分级,小时级中,同样也会存在这样的情况,处理方式也一样。当传来的消息时间戳在(t,t+5)的区间中,会进入分区,如果出现一条消息的时间戳大于t+5,那么这个分区就会锁起来

文章图片
#flink#kafka#数据仓库 +1
到底了