logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

使用sqoop从mysql导入到hive一张名叫warehouse的表引发的问题

今天,我使用sqoop导入数据的时候遇到一个很奇怪的问题,我将mysql一张名为warehouse的表导入到hive的时候,出现如下报错提示我没有hdfs改路径的写入权限?但是正常情况我写入hdfs的路径不应该是这个路径啊,难道是日志打错了?于是我重试了几次,发现还是不行;难道是sqoop出了问题?但是我导其他表也没有问题啊;那只能是这个表有问题了,表名为warehouse,我们hive的库也叫w

#hive#mysql#sqoop
hive with as 和直接创建临时表的性能比较;

我之前的理解是使用with 时,就是相当于把字查询给提取出来,这样代码可读性更高,并且该子查询可以重复使用,并且相较于直接创建临时表不会落盘,这样效率会.......直到有一次,我优化一个大job,发现这个大job全是用创建临时表的方式保存中间结果,我想着这要是全部改成with的方式那效率还不提高好多???我立马开干,三下五除二就全部换成with的语句了,结果执行的时候发现居然执行不动!!原本一个

#hive
hive创建永久自定义函数不生效的问题

hive自定义函数可以帮我们轻松解决很多sql不好实现的逻辑,所以偶然写写自定义函数还是很有用的. 但是我最近遇到一个问题,就是我函数写好了,使用CREATE FUNCTION default.temporary_time_combine as 'com.saas.ylz.bigdata.udf.TemporaryTimeCombine'using jar 'hdfs:///hive/udf/te

#hive
HIVE sparkSQL sum()over()开窗函数的效率问题

开窗函数大家都用过,其中sum()的开窗函数我们可以很好的用来求一些累加的值,我之前一直认为开窗函数的执行效率都差不多,然而有一次我使用sum开窗函数计算某个车辆每个时间累积行驶了多少距离,由于有定位数据,数据量比较大,300万左右,结果程序执行了超过一个小时都不出结果,然后我用排除法把sum换成row_number,结果秒出结果.我才发现sum的不同...

文章图片
#hive#c语言#c++
到底了