logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

zookeeper的选举机制

启动第二台,先投自己一票,然后第一台开始投票,比较两者之间谁的myid大,谁的大,就投给谁,zk02再得一票,第二台两票,超过了半数,领导出现了zk02.启动第一台,第一台开始选举,自己投自己一票,因为超过半数才有效,所以zk01不是领导,此时的状态是选举中。zxid代表的是事务的次数如果这个值很大,就表示这个机器上的数据比较的新。如果zxid 也相等,就看每台电脑上的myid了,如果myid谁大

文章图片
#zookeeper#分布式#云原生 +4
hive分区详细教程

为了提高sql的查询效率比如:假如数据量比较大,这个sql就是全表扫描,速度肯定慢。可以将数据按照天进行分区,一个分区就是一个文件夹,当你查询20230826的时候只需要去20230826这个文件夹中取数据即可,不需要全表扫描,提高了查询效率。总结1)分区表实际上就是对应一个HDFS文件系统上的独立的文件夹。2)该文件夹下是该分区所有的数据文件。3)Hive中的分区就是分目录,把一个大的数据集根据

文章图片
#hive#hadoop#数据仓库 +4
在pycharm上运行spark-core时报Connection reset by peer: socket write error

在运行 pyspark 代码读取数据后,有时候会出现这个错误。1、将数据量变小一点,只截取一部分进行测试。2、不要使用take算子了。3.使用foreach算子。

文章图片
#spark#大数据#分布式 +1
到底了