
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Hadoopd分布式计算框架——MapReduce
关于数据仓库中变化历史数据处理方式:全量表、快照表、拉链表一、全量表二、快照表三、拉链表对于数据仓库中变化的历史数据存储,一般有三种方式:全量表、快照表、拉链表一、全量表直接全量导入,覆盖旧数据,保存每天所有的最新状态的数据优点: 效率比较高,可以查看最新数据缺点: 查看不到历史数据二、快照表按日分区,记录截止数据日期的全量数据,一天一个分区优点:效率比较高,可以查看最新数据也可以查看历史数据缺点
使用spark算子练习mysql经典50道题一、mysql经典50道题一、mysql经典50道题学生表 Studentstudent_idstudent_namebirthsex1赵雷1990-01-01男2钱电1990-12-21男3孙风1990-05-20男4李云1990-08-06男5周梅1991-12-01女6吴兰1992-03-01女7郑竹1989-07-01女8王菊1990-01
搭建hadoop单机环境(伪分布式)一、准备工作1.安装包下载:三级目录1一、准备工作22.安装包三级目录2一、准备工作1.安装包下载:三级目录1一、准备工作22.安装包三级目录2
ZooKeeper简介一、ZooKeeper简介Zookeeper是一个开源的分布式的,为分布式应用提供协调服务的Apache项目Zookeeper=文件系统+通知机制Zookeeper从设计模式上来看是一个基于观察者模式设计的分布式服务管理框架,它负责存储和管理大家都关心的数据,然后接受观察者的注册一旦数据的状态发生变化,Zookeeper就将负责通知已经在Zookeeper上注册的那些观察者做
Spark应用之日志数据清洗一、日志数据二、准备工作三、数据清洗3.1 清洗数据 user.csv3.2 清洗数据 event.csv3.3 清洗数据 user_friends.csv一、日志数据日志数据:下载链接:events提取码: ngs3二、准备工作下载日志数据将下载的日志数据上传至hdfs:/eventData文件夹linux 启动spark,spark安装根目录输入:sbin/star
Git仓库使用一、安装Git二、安装插件工具 TortoiseGit三、Git常用操作3.1 Git的工作流程3.2 创建版本库3.2.1 使用Git GUI3.2.2 使用Git Bash3.2.3 使用TortoiseGit一、安装Git下载地址:https://git-scm.com/download笔者下载的版本是: Git-2.27.0-64-bit.exe下载好之后双击打开一连续点击
zeppelin环境搭建及连接hive使用一、准备工作1.zepeelin简介2.安装包下载3.环境要求二、解压安装三、修改配置文件1.修改配置文件zeppelin-site.xml2.修改zeppelin的环境文件四、启动zepeelin五、配置hive解释器1.配置hive的环境变量至zeppelin中2.在web页面配置集成hive2.1需先启动hadoop和hive服务2.2启动zeppe
Hbase常用操作一、hbase shell基本命令二、将本地表数据批量导入到hbase中三、hbase与hive映射一、hbase shell基本命令判断表存在与否exists 'tablename'使用通配符的方式列出所有表list 'abc.*'查看HBase 的版本version查看HBase 的状态status查看HBase 帮助文档help创建一个表user,列族为baseinfo,p
邻近算法(KNN)原理简单解析 一、什么是邻近算法1.1简介1.2核心思想1.3 算法流程1.4 优缺点二、实例演示KNN算法一、什么是邻近算法1.1简介邻近算法,或者说K最近邻(KNN,K-NearestNeighbor)分类算法是数据挖掘分类技术中最简单的方法之一。所谓K最近邻,就是K个最近的邻居的意思,说的是每个样本都可以用它最接近的K个邻近值来代表。近邻算法就是将数据集合中每一个记录进行分







