logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Guava 在大数据计算场景下的使用指南

场景推荐工具维度聚合MultimapTable缓存加速Cache字符串清洗SplitterJoiner双向映射BiMap限流写入集合比较SetsMaps不可变共享提升开发效率、增强代码健壮性、避免重复造轮子。合理搭配可显著减少样板代码。

#guava#大数据
12、记录一次Spark写大数据量到对象存储极度缓慢而了解到的Filecommitter一些知识点

数据数据量很大其实也还好,不是很夸张,就是分区较多几千个吧,然后上游任务也没有控制好小文件,导致每个分区里都要好多小文件,在此背景下,任务执行了好几个小时了,我看driver和executor都还在运行没有停下来意思,那不用多想,肯定是哪儿出了问题,按照我排除数据任务问题的思路,先去看看driver的日志,没有啥异常,日志老早就不打了,再看看executor的日志,一样,日志老早也不打了,并且ex

文章图片
#spark#大数据#分布式 +1
37、org.apache.hadoop.hive.serde2.JsonSerDe的源码修改

在spark-measure源码修改用于数据质量笔记中,说到了使用hive外部表读取spark-measure的监测结果json数据。hive外部表ddl使用了 ROW FORMAT SERDE ‘org.apache.hadoop.hive.serde2.JsonSerDe’。但是在spark离线项目中因为hive版本的原因导致spark无法通过hive表读取数据。

文章图片
#hadoop#apache#hive +1
38、spark读取hudi报错:java.io.NotSerializableException: org.apache.hadoop.fs.Path

场景:spark.table()的方式读取hudi映射的hive表。开源组件版本:hive3.1.0。

文章图片
#spark#java#apache
38、spark读取hudi报错:java.io.NotSerializableException: org.apache.hadoop.fs.Path

场景:spark.table()的方式读取hudi映射的hive表。开源组件版本:hive3.1.0。

文章图片
#spark#java#apache
17、使用SparkTs进行时序预测

之前也做过时序预测的业务,只不过使用的是pyspark+fbprophet(下次记录一下pyspark+fbprophet的使用笔记),这次使用sparkts里的holtWinters模型批量对多个商户的营业额进行预测。

文章图片
#spark#机器学习
37、org.apache.hadoop.hive.serde2.JsonSerDe的源码修改

在spark-measure源码修改用于数据质量笔记中,说到了使用hive外部表读取spark-measure的监测结果json数据。hive外部表ddl使用了 ROW FORMAT SERDE ‘org.apache.hadoop.hive.serde2.JsonSerDe’。但是在spark离线项目中因为hive版本的原因导致spark无法通过hive表读取数据。

文章图片
#hadoop#apache#hive +1
5、spark.sql.codegen.wholeStage: ‘false‘ 关闭spark sql 语句长度校验

如题,当在Spark 任务中,通过一些例如递归等方式 去构建dataframe或者dataframe的过滤条件等,可能会出现spark sql 长度超过限制的报错,可以通过设置 spark.sql.codegen.wholeStage: ‘false’ 来关闭长度校验。

文章图片
#spark#sql#大数据
16、SparkMl的简单使用

SparkMl使用的不多,一两年前业务上需要就用了一下,之后就没再使用了,最近又有需求了,使用SparkMl做了一下时序预测,先在这一篇笔记里记录一下之前使用SparkMl的简单应用。这个案例使用的是随机森林模型。

文章图片
#spark-ml#机器学习
到底了