logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

pyspark

连接命令:一个application 大任务可以分解成 多个小任务 jobs, 一个job又可以分解成多个 stages 阶段,一个stage又可以分解成 多个tasks(可以认为是两个线程)standalone Zookeeper 高可用HA,集群中存在多个master,但最先注册的成为active,其它是standby,集群包含Worker、Driver、Applicationmaster由r

文章图片
#大数据
当spark涉及数据库操作时,如何减少spark运行的数据库连接数?

4.使用foreachpartition代替foreach,在foreachpartition内获取数据库连接。foreachpartition原理是 在每个分区中把iteritor传入func中,由func控制这批迭代。foreach原理是 在每个分区中在iteritor遍历一条然后调用的func处理。2.使用连接池,较少创建销毁的开销。

文章图片
#spark#数据库#大数据
排序算法简述

mapreduce中的排序算法即作用归并排序(Merge sort)是建立在归并操作上的一种有效、稳定的排序算法,该算法是采用分治法(Divide and Conquer)的一个非常典型的应用。将已有序的子序列合并,得到完全有序的序列;即先使每个子序列有序,再使子序列段间有序。若将两个有序表合并成一个有序表,称为二路归并总结:归并是将子序列合并的意思,合并的方法是用辅助列实现。快速排序:使用递归的

文章图片
#排序算法#算法
到底了