
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
flink本地运行,访问webui方法:添加依赖:flink-runtime-web一定要添加这个依赖,否则访问页面是会报{“errors”:[“Not found.”]}<dependency><groupId>org.apache.flink</groupId><artifactId>flink-runtime-web_2.11</arti
一年多前写的用spark 实现sqoop类似功能的数据同步工具,拿出来分享一下优点:1.用配置代替sqoop命令,维护简单,添加新增同步表或下线同步表,只需在sql中增加或删除即可2.实测性能比sqoop好,当然前提是内存资源足够实现功能:1.通过配置需要同步的表清单元数据,实现多表并行从mysql同步到hive2.通过配置表同步类型,实现全量同步,增量同步,是否重跑功能2.通过配置表的并行分区字
1.Exception in thread “main” java.lang.NoSuchMethodError:scala.collection.immutable.HashSet$.empty()Lscala/collection/immutable/HashSet;解决:scala版本不对,将scala 2.11 换成scala 2.102.win7 运行saprk程序会报如下报错误:Fai
在使用spark streaming将数据灌入hive时,或者spark批处理时如果分区设得很大,会导致hive表生成很多hdfs小文件,这个问题到目前位置spark都没有比较好的解决方法(不知道spark3.0情况是什么样的)折中解决:hive表按小时分区,sparkstreaming灌入hive后,在每个小时节点设置一个合并任务,将上一个小时分区数据的小文件进行合并,其实就是将分区数据读出来使







