logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

spring boot自动配置原理

spring boot 在启动时,会加载spring boot autoconfigigure  /META-INF/spring.factories,定义了初始化设置类,将初始化的环境纳入spring 的容器中.如下:当我们运行XXXApplication的main方法的时候 springApplication.run(xx.class)会首先执行springApplication的初始化方法,

mysql版本升级导致的时区问题

在美国从东向西分别为东部时间(EST)(西五区时间)、中部时间(CST)(西六区时间)、山地时间(MST)(西七区时间)、太平洋时间(西部时间)(PST)(西八区时间)、阿拉斯加时间(AKST)(西九区时间)和夏威夷时间(HST)(西十区时间)从东向西分别为东部时间(EST)(西五区时间)、中部时间(CST)(西六区时间)、山地时间(MST)(西七区时间)、太平洋时间(西部时间)(PST)(西八区

文章图片
#mysql#数据库
spark程序运行完了但是一直卡住。

spark 任务也跑完了,卡在最后,一直没结束。因为我之前开了一个线程池,用完了没关闭。

#spark
spark代码之使用各种函数

1.通过functions.xxx去调用函数 涉及到 groupsum distinctorder bydesc ,,row_number()over(partition by )如果我们想saveastable 也建议select(id,name,score) ,不影响使用,只是字段位置按照英文字母顺序排列建的。saveAstable是保存为表,每次会覆盖之前的表结构(有一定概率出错,出错了 h

#spark#java#大数据
spark-submit源码解析

简化为 /data/cloudera/parcels/CDH-6.3.2-1.cdh6.3.2.p0.1605554/lib/spark/bin/spark-class org.apache.spark.deploy.SparkSubmit "$@"exec $LIB_DIR/spark/bin/spark-submit "$@"--再次把参数传递给另外一个spark-submit。${CLOUE

#spark
hive on spark 解决分区表目录下多个空文件

说明了啥,spark.merge 是针对非空文件去merge的或者说这个参数起效,一个目录下必须有一个非空文件,我这几个目录都是1000个空文件,所以根本不merge。上述就是空文件,暂时不测试了。本来想着下次更新,但是想了下,问题也不复杂,继续研究下。按道理spark 会自动merge小文件的,为啥没有merge呢?但是这样也会有一定的问题,reduce只有10个速度效率会有所下降。首先思考下为

#hive#spark
cdp搭建测试spark功能 遇到问题

公司集群由cdh换成了cdp。用spark代码测试 读取hive内的ods数据经过map等算子转化,然后存取到另外一个dw表里。代码都在cdh里ok的,已经发布生产。备注cdh, spark版本为2.4.0-cdh6.3.2 hive版本为 2.1.1-cdh6.3.2cdp spark版本为2.4.7.7.1.7.0-551 hive版本 3.1.3000.7.1.7.0-551本着简单的方式只

#spark
spark sql之巧用group by

大数据(big data),是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。1.5*1000*1000*1000kb=1.5*1000*1000mb=1.5*1000G=1.5T 当然我这个计算是不准确的。我这里都是自己想的。这个就是我最开始提出的疑问 有的key是合并了。所以我

#spark#sql#大数据
hive on spark问题总结

截取错误关键点ERROR : FAILED: Execution Error, return code 30041 from org.apache.hadoop.hive.ql.exec.spark.SparkTask. Failed to create Spark client for Spark session b833a645-a100-4556-80fb-64ffd5e60aa7_0: j

hive on spark 之通过spark web ui详解数据倾斜及思路历程

差不多就是如下 a join bjoin c join djoin e join f 一长串。说实话我也难搞,每次就是一长串sql让我找问题 让我优化,我看完sql理解下都要十几分钟。。。

#spark#hive#大数据
    共 38 条
  • 1
  • 2
  • 3
  • 4
  • 请选择