
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
set hive.input.format=org.apache.hadoop.hive.ql.io.CombineHiveInputFormat; #默认set hive.input.format=org.apache.hadoop.mapred.TextInputFormatorg.apache.hadoop.hive.ql.io.orc.OrcOutputFormat
小文件的缺陷我们就不说了,直接进入到正题.HIVE自动合并输出的小文件的主要优化手段为:set hive.merge.mapfiles = true:在只有map的作业结束时合并小文件,set hive.merge.mapredfiles = true:在Map-Reduce的任务结束时合并小文件,默认为False;set hive.merge.size.per.task = 256000000;
前言在yarn上跑的程序必须拥有代码,环境,配置。flink on yarn模式,用户提交完jar以后,通过yarn调度队列,任务jar会被分配到某个节点,连同配置,环境,一起被分发到某个Task节点。flink run 命令参数详情1 参数必选 :-n,--container <arg>分配多少个yarn容器 (=taskmanager的数量)2 参数可选 :-D <arg&g
现象删除一张表时,发现执行不报错,但是一直卡住。执行其他表查询或者删除语句正常,查看元数据库字符集正常。锁定问题在于单表,查询HIVE_LOCKS发现该表存在锁。复现原因,执行过程中关闭了session窗口(xshell),导致加锁未释放。(在hive操作过程中强制退出后,会导致锁表,并且unlock命令无效)解决办法此时可以去mysql的元数据库中解锁 mysql的元数据中解锁的命令是不同版本可
Scala版Flink程序编写本项目使用的Flink版本为最新版本,也就是1.11.2。现在提供maven项目的配置文件。使用Intellij IDEA创建一个Maven新项目勾选Create from archetype,然后点击Add Archetype按钮GroupId中输入org.apache.flink,ArtifactId中输入flink-quickstart-scala,Versio
前言因为升级mysql导致结构错误版本由5.6升级到5.7的时候发现报错解决办法关闭mysql服务service mysqld stop修改/etc/my.cnf# For advice on how to change settings please see# http://dev.mysql.com/doc/refman/5.6/en/server-configuration-defaults
@echo offremset REPOSITORY_PATH=E:\repositoryremfor /f “delims=” %%i in (‘dir /b /s “%REPOSITORY_PATH%*lastUpdated*”’) do (del /s /q %%i)rempause
前言hive经常用于数仓,但是由于他的计算引擎(默认是MR)不支持DAG(Directed Acyclic Graph)DAG解释,所以导致效率低下,所以一般生产中用集成Tez详细配置解析,笔者就在这里简单的记录下配置。解压安装将apache-tez-0.9.1-bin.tar.gz上传到HDFS的/tez目录下。这一步是因为tez是在yarn上运行Tezjob,但是如果只装在一台机器上...
问题编写Hive自定义UDF以及UDTF函数时,测试都通过了,但是在附带依赖打包的时候发现了一个错误!错误代码:Failure to findorg.pentaho:pentaho-aggdesigner-algorithm:pom:5.1.5-jhyde inhttp://maven.aliyun.com/nexus/content/repositories/central/ wa...
前言目前在整理hadoopHA搭建素材,整理好后贴上链接!简介What is Hive!Hive是一种数据仓库软件,使用SQL来促进对分布式设备上存储的大体量的数据集进行读,写和管理!SQL(结构化查询语言),使用SQL的前提是需要有一张表!Hive分析数据必须可以映射为一个表结构!Hive提供了JDBC驱动和命令行工具,让用户连接Hive!Hive基于H...







