
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
场景推荐工具维度聚合MultimapTable缓存加速Cache字符串清洗SplitterJoiner双向映射BiMap限流写入集合比较SetsMaps不可变共享提升开发效率、增强代码健壮性、避免重复造轮子。合理搭配可显著减少样板代码。
数据数据量很大其实也还好,不是很夸张,就是分区较多几千个吧,然后上游任务也没有控制好小文件,导致每个分区里都要好多小文件,在此背景下,任务执行了好几个小时了,我看driver和executor都还在运行没有停下来意思,那不用多想,肯定是哪儿出了问题,按照我排除数据任务问题的思路,先去看看driver的日志,没有啥异常,日志老早就不打了,再看看executor的日志,一样,日志老早也不打了,并且ex

在spark-measure源码修改用于数据质量笔记中,说到了使用hive外部表读取spark-measure的监测结果json数据。hive外部表ddl使用了 ROW FORMAT SERDE ‘org.apache.hadoop.hive.serde2.JsonSerDe’。但是在spark离线项目中因为hive版本的原因导致spark无法通过hive表读取数据。

场景:spark.table()的方式读取hudi映射的hive表。开源组件版本:hive3.1.0。

场景:spark.table()的方式读取hudi映射的hive表。开源组件版本:hive3.1.0。

之前也做过时序预测的业务,只不过使用的是pyspark+fbprophet(下次记录一下pyspark+fbprophet的使用笔记),这次使用sparkts里的holtWinters模型批量对多个商户的营业额进行预测。

在spark-measure源码修改用于数据质量笔记中,说到了使用hive外部表读取spark-measure的监测结果json数据。hive外部表ddl使用了 ROW FORMAT SERDE ‘org.apache.hadoop.hive.serde2.JsonSerDe’。但是在spark离线项目中因为hive版本的原因导致spark无法通过hive表读取数据。

如题,当在Spark 任务中,通过一些例如递归等方式 去构建dataframe或者dataframe的过滤条件等,可能会出现spark sql 长度超过限制的报错,可以通过设置 spark.sql.codegen.wholeStage: ‘false’ 来关闭长度校验。

SparkMl使用的不多,一两年前业务上需要就用了一下,之后就没再使用了,最近又有需求了,使用SparkMl做了一下时序预测,先在这一篇笔记里记录一下之前使用SparkMl的简单应用。这个案例使用的是随机森林模型。








