logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Streamsets Mysql全量导同步到hive

三种方式根据需要弄哈;增量的,我觉得实际业务中,除非没有update操作才适合使用JDBC这种增量方式,不然都是扯犊子,毕竟hdfs对随机写不是很友好。这是全量的,慢的很。没有sqoop快。1、JDBC Query Consumer (单表全量)2、 JDBC Multitable Consumer (单库多表全量)3、分区同步建议使用下面的 (单表分区)配置文件很简单。这里不说,有需要的小伙伴可

#etl
kettle 9.1 连接hadoop clusters (CDH 6.2)

1、右键点击Hadoop clusters 点击add driver。2、点击窗口Browse选择:C:\Users\famil\Downloads\data-integration\ADDITIONAL-FILES\drivers中的pentaho-hadoop-shims-cdh61-kar-9.1.2020.09.00-324.kar 选择下一步安装。3、右键点击Hadoop cluster

#hadoop#java#数据库
CDH6.2.0 集成Apache atlas 详细的编译安装

不说环境了,都到了元数据管理,基本的需要的java、maven肯定是不可少的。编译:官网下载apache-atlas-2.2.0-sources.tar.gz解压 tar -zxvf apache-atlas-2.2.0-sources.tar.gz编译,进入目录 mvn clean -DskipTests package -Pdist编译好了之后进入apache-atlas-sources-2.

#hive#大数据
到底了