
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
一、dataX概览1.1 DataXDataX 是阿里巴巴集团内被广泛使用的离线数据同步工具/平台,实现包括 MySQL、SQL Server、Oracle、PostgreSQL、HDFS、Hive、HBase、OTS、ODPS 等各种异构数据源之间高效的数据同步功能。1.2 FeaturesDataX本身作为数据同步框架,将不同数据源的同步抽象为从源头数据源读取数据的Reader插件,以及向目标
大数据-玩转数据-Hadoop+Storm与Spark架构方案比较Hadoop+Storm方案结构图Spark方案结构图Hadoop的数据处理工作在硬盘层面,借助HDFS(分布式文件系统),可以将架构下每一台电脑中的硬盘资源聚集起来,之后使用集群管理和调度软件YARN,最后利用Map/Reduce计算框架,就可以在这上面进行计算编程。由于Hadoop的计算过程放在硬盘,受制于硬件条件限制,数据的吞
大数据-玩转数据-Spark-RDD编程基础-RDD创建(python版)本章为hadoop+spark+yarn 的pyspark交互式环境。[root@hadoop1]# cd /home/hadoop/spark/bin[root@hadoop1 bin]# pyspark默认本地启动pyspark一、RDD创建Spark采用textFile()方法从文件系统中加载数据创建RDD1、从文件系
大数据-玩转数据-Yarn 与StandAlone调度对比MapReduce中的maptask和reducetask都是在YarnChild中进行计算的,YarnChild是一个进程,使用jps命令可以看到它们的区别:1.yarnSparkResourceManagermaster作用:管理子节点,资源调度,接收任务请求2.yarnsparknodemanagerworker管理当前节点,并管理子
大数据-玩转数据-Sqoop安装部署及应用说明:Sqoop是apache旗下的一款 ”Hadoop和关系数据库之间传输数据”的工具导入数据 import将MySQL,Oracle导入数据到Hadoop的HDFS、HIVE、HBASE等数据存储系统导出数据 export从Hadoop的文件系统中导出数据到关系数据库。Sqoop安装部署1、下载安装包https://attic.apache.org/p
大数据-玩转数据-Spark-Structured Streaming 容错(python版)说明:由于网络问题,链路中断,系统崩溃,JVM故障都会导致数据流的运行结果出现错误,Spark设计了输入源,执行引擎和接收器多个松散耦合组件隔离故障。输入源通过位置偏移量来记录目前所处位置,引擎通过检查点保存中间状态,接收器使用“幂等”的接收器来保障输出的稳定性。我们希望数据是它产生的时间,而不是到达的时
前言Oracle GoldenGate,简称OGG,是一种基于日志的结构化数据复制备份软件,它通过解析源数据库在线日志或归档日志获得数据的增量变化,再将这些变化应用到目标数据库,从而实现源数据库与目标数据库同步。Oracle GoldenGate可以在异构的IT基础结构(包括几乎所有常用操作系统平台和数据库平台)之间实现大量数据亚秒一级的实时复制,从而在可以在应急系统、在线报表、实时数据仓库供应、
如果Flink没有提供给我们可以直接使用的连接器,那我们如果想将数据存储到我们自己的存储设备中,mysql 的安装使用请参考。

一、数据分析步骤二、数据分析知识库三、数据分析师能力体系
大数据-玩转数据-vmware虚拟环境搭建网络补充如要把虚拟机网络桥接模式改为NAT模式1、把你的虚拟机打开,启动系统成功后,在虚拟机-设置,修改网络连接为NAT模式。2、虚拟机里,打开编辑-虚拟网络编辑器-查看NAT模式-NAT设置,记住系统生成的网关(可修改,修改最后一个网段值)。3、然后在物理机也就是你的宿主机里找到网络连接,启用VM8网卡,然后禁用其他的VM网卡,设置其IP的网关为虚拟机中







