logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

hdfs权限问题chmod: changing permissions of ‘/user/hive/warehouse‘: Permission denied. user=root is not t

将某个用户,添加到,hdfs超级管理员组中。更新权限到hdfs文件系统。

#hdfs#hive#hadoop
hdfs和hive数据迁移后校验脚本

先谈论校验方法,本人腾讯云大数据工程师。

文章图片
#hive#hadoop#数据仓库
hive迁移后修复分区慢,怎么办?

二级分区:altertableXXaddpartition(etl_yn=2024,etl_mn=01);使用hive自带的修复分区命令(一般修复分区比迁移时间长一点),可能要花24小时。我有个30TB的分区表,客户给的带宽只有600MB,按照150%的耗时来算,大概要迁移17小时。改用addpartition后,1000个分区的表,10min内。Hive增量迁移:创建表结构+数据迁移(distc

文章图片
#hive#hadoop#数据仓库
JAVA elasticsearch批量插入

【代码】JAVA elasticsearch批量插入。

文章图片
#elasticsearch#java#搜索引擎
hive高阶,了解hive相关问题,面试

打开hive-ui,可以发现某一个Map任务耗时远超其他的Map任务,此时没有特别好的手段,若是hiveSql,可以group by 这个key,看一下是哪个,对他进行业务上的拆分。Reduce的发现是卡在99%,其他的reduce都完成了,看一下Task处理数量,可以开启group by聚合,map端预聚合是默认开启的,看一下reduce日志,oom,还是节点挂了,观察他的sql,看看是聚合场景

#hive#hadoop#数据仓库
dataX(入门,mysql到doris)

DataX是一款数据同步工具,可用于将MySQL数据迁移至Doris数据库。通过配置文件设置同步参数,包括数据源连接信息(需暴露账号密码,建议在内网使用)、查询SQL及目标库配置。示例配置展示了MySQL到Doris的数据迁移任务,包含通道数、容错限制及字段映射等设置。使用DataX时需注意账号密码明文存储的安全风险,建议仅在内网环境执行此类敏感操作。

#android#数据库
微信小程序登陆(全流程-前后端)

1.注册一个小程序2.微信开发者工具其实微信前端是可以直接请求获取openId的,但是会暴露你的key和secret流程:前端获取code->后端调用微信接口->返回openid给前端。

文章图片
#微信小程序#小程序#微信
spark集群搭建

spark有4种模式,单节点(没人用)这里主要搭建yarn和standalone

#spark#大数据#java
hive建表,与插入数据

固建立临时表(不分区),导入数据到临时表,创建分区表,通过【insert 分区表 select 临时表】 导入分区表。,需要通过insert parquet格式的表 select * textfile格式的表)存储格式用parquet,压缩数据,比orc差,查询一致,但是插入快(一致,他会把hdfs的文件copy到hdfs的hive表下。思路,hive导入分区表,只能通过临时表导入。准备数据,这种

#hive#大数据#hadoop
    共 110 条
  • 1
  • 2
  • 3
  • 11
  • 请选择