logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

ranger与solr&ldap&doris集成部署

MPP前置环境安装依赖环境######################################################################################################

#solr#lucene
hive通过元数据库删除分区操作步骤

删除分区参数(PARTITION_PARAMS,如果有)– 删除分区键值(PARTITION_KEY_VALS)– 可选:删除统计信息(PART_COL_STATS)2、 查询分区的PART_ID和SD_ID。– 删除存储描述(SDS,确保无其他引用)– 删除分区记录(PARTITIONS)1、查询分区的DB_ID、TBL_ID。– 根据分区键值查找PART_ID。– 获取数据库ID-26110。

文章图片
#服务器#linux#运维
MR3加速hive和spark任务

凭借其先进的资源共享模型,MR3上的Hive可以节省大量成本,尤其是在许多ETL作业并发运行的情况下。与仍然需要Java8的ApacheHive不同,MR3上的Hive可以与Java17一起运行。普通Spark,不同的Spark应用程序必须维护自己的一组executor,因为Spark缺乏在Spark应用程序之间回收计算资源的功能。MR3上的Hive无需额外配置即可自动达到LLAP及以上的速度。2

文章图片
#hive#spark#hadoop
flink-paimon建表建议

小文件合并策略,当存在10个level 0级文件则触发minor合并。string comment ‘月分区’,– 设置分桶 单个分桶文件建议大小200M -1G,根据数据量调整。– 依照时间字段去重(新数据更新老数据) 根据业务调整。– 快照最多保留个数 根据业务调整。– 快照保留1天 根据业务调整。– Hive HMS分区同步。

#flink#大数据
hadoop平台问题总结

控制 Hive 是否将 CTE(WITH 子句)的结果物化(materialize)到临时表中,以避免重复计算。不创建HDFS目录:/user/hive/warehouse/target_table/dt=20251214/true:使用 Spark 内置的 Parquet 数据源(更快、功能更全)1、解决spark有数据,tez读不到数据问题。2、解决tez有数据,spark读不到的问题。– 问

#大数据
利用doris-catalog跨大数据平台导数

无需移动数据,即可直接关联分析不同数据源的表。切换 Catalog 后,即可像查询内部数据一样操作。查看 Catalog。切换 Catalog。跨Catalog查询。

#大数据
hadoop客户端手动安装

1、集群主机安装包:集群安装路径:/usr/difjdk路径:/usr/java/jdk1.8.0_202-amd642、同步数据到安装的客户端主机:scp -r /usr/dif XXXip:/XXX/scp -r /usr/java/jdk1.8.0_202-amd64 XXXip:/XXX/3、在客户端主机上,在/etc/hosts中添加大数据平台的相关主机:sudo vi /etc/hos

#hadoop#eclipse#大数据
spark History Server 重启失败

Ambari 在启动 Spark History Server 时,会通过 fast-hdfs-resource.jar 执行一系列 HDFS 资源操作,其中包括递归设置 /spark-history/ 目录权限(mode=0777)。该操作会遍历目录下的所有文件,但当它遇到一个已经被删除的 .inprogress 文件时(可能是因为文件在遍历过程中被清理程序删除),就会抛出 FileNotFou

#spark#大数据#分布式
docker 安装app

浏览器中访问:http://localhost:9089。默认密码:congjingkeji。默认用户名: admin。

#docker#adb#容器
    共 19 条
  • 1
  • 2
  • 请选择