
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
小文件合并策略,当存在10个level 0级文件则触发minor合并。string comment ‘月分区’,– 设置分桶 单个分桶文件建议大小200M -1G,根据数据量调整。– 依照时间字段去重(新数据更新老数据) 根据业务调整。– 快照最多保留个数 根据业务调整。– 快照保留1天 根据业务调整。– Hive HMS分区同步。
控制 Hive 是否将 CTE(WITH 子句)的结果物化(materialize)到临时表中,以避免重复计算。不创建HDFS目录:/user/hive/warehouse/target_table/dt=20251214/true:使用 Spark 内置的 Parquet 数据源(更快、功能更全)1、解决spark有数据,tez读不到数据问题。2、解决tez有数据,spark读不到的问题。– 问
无需移动数据,即可直接关联分析不同数据源的表。切换 Catalog 后,即可像查询内部数据一样操作。查看 Catalog。切换 Catalog。跨Catalog查询。
1、集群主机安装包:集群安装路径:/usr/difjdk路径:/usr/java/jdk1.8.0_202-amd642、同步数据到安装的客户端主机:scp -r /usr/dif XXXip:/XXX/scp -r /usr/java/jdk1.8.0_202-amd64 XXXip:/XXX/3、在客户端主机上,在/etc/hosts中添加大数据平台的相关主机:sudo vi /etc/hos
Ambari 在启动 Spark History Server 时,会通过 fast-hdfs-resource.jar 执行一系列 HDFS 资源操作,其中包括递归设置 /spark-history/ 目录权限(mode=0777)。该操作会遍历目录下的所有文件,但当它遇到一个已经被删除的 .inprogress 文件时(可能是因为文件在遍历过程中被清理程序删除),就会抛出 FileNotFou
浏览器中访问:http://localhost:9089。默认密码:congjingkeji。默认用户名: admin。
在当前目录下产生: wf_bg_sacmpp.keytabwf_bg_sacmpp/wf-gd2-bpit-dp-dn-17-80@GK.COM。ldap中增加用户之后,ranger会自动同步(需要等一段时间),重启ranger usersync 服务 立马同步。2、查看principal 检查principal保证要建的principal没有。库:ods_erp_newproj_dim_new。
浏览器中访问:http://localhost:9089。默认密码:congjingkeji。默认用户名: admin。
当启动一个spark任务的时候,就会占用一个端口,默认从4040开始探测,默认依次增加16次到4056,如果还是失败的话,就会报错退出。意味着Spark UI无法绑定到预期的端口。

可根据查看parquet文件信息验证parquet文件元数据格式与hive表定义元数据进行比对,将修改Hive表定义字段类型即可解决。该问题常见于parquet格式hive表查询时,一般原因为hive表对应数据文件元数据对应格式与hive表定义格式不匹配导致。1、修改hive表的字段类型 注意如果需要级联修改需要使用关键字cascade。2、修改生成parquet的字段类型。








