logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【Hive】二、Hive 分区与分桶:深入理解 Hive 分区与分桶的原理、MapJoin、Bucket Map Join、SMB Join 以及最佳实践

本文分析了Hive表在1:不分区不分桶,2:分区不分桶,3:不分区分桶,4:分区分桶共四种情况下的执行原理与性能差异。

文章图片
#hive#hadoop#数据仓库
【Hive】一、Hive数据类型:基本数据类型、复杂数据类型

介绍Hive支持的基本数据类型(TINYINT、INT、DOUBLE、DECIMAL、STRING等)和复杂数据类型(ARRAY、MAP、STRUCT)

文章图片
#hive#hadoop#数据仓库
【Hive】三、Hive 抽样:讲解 Hive 三大抽样方式:分桶抽样、块抽样、随机抽样的原理、语法、性能对比与实战案例

讲解 Hive 三大抽样方式:分桶抽样、块抽样、随机抽样的原理、语法、性能对比与实战案例

文章图片
#hive#hadoop#数据仓库
【Hive】四、Hive SQL语法:Hive 数据库 / 表的 DDL(建库、建表、内外部表、分区、分桶、CTAS)以及 DQL 查询语法(SELECT、WHERE、GROUP BY、排序、JOIN

系统梳理 Hive 数据库 / 表的 DDL(建库、建表、内外部表、分区、分桶、CTAS)以及 DQL 查询语法(SELECT、WHERE、GROUP BY、各种排序、JOIN、UNION 等)

文章图片
#数据库#hive#sql
【Hive】五、Hive 存储格式与压缩:深入行存与列存原理、Hive 主流存储格式(TextFile / SequenceFile / RCFile / ORC / Parquet / Avro)

深入讲解行存与列存原理、Hive 主流存储格式(TextFile / SequenceFile / RCFile / ORC / Parquet / Avro)以及 Hadoop / Hive 中各种压缩算法的选型和参数配置

文章图片
#hive#hadoop#数据仓库
【Hive】六、Hive 运算逻辑:数学 / 逻辑 / 条件 / 日期 / 字符串函数

全面梳理 Hive 的数学运算、逻辑运算、条件函数(IF/CASE/COALESCE/NVL)、日期函数(时间戳互转/加减/截断)以及字符串函数(截取/拼接/正则/JSON 解析)的语法与易错点

文章图片
#hive#hadoop#数据仓库
【Hive】七、Hive 函数:聚合 / 统计 / 分位数 / 集合 / 高级分组

系统讲解 Hive 聚合函数(count/sum/avg/max/min)、统计学函数(方差/标准差/协方差/相关系数)、分位数(percentile / percentile_approx)、集合聚合(collect_list/collect_set/map_agg)以及 GROUPING SETS / CUBE / ROLLUP 多维分析

文章图片
#hive#hadoop#数据仓库
【Hive】 八、Hive 计算引擎:MapReduce / Tez / Spark 对比与选型

系统梳理大数据三类计算引擎(批处理 / 流处理 / 查询)的边界与职责,并深入对比 Hive 支持的 MapReduce、Tez、Spark 三种执行引擎的原理、优缺点与工程选型建议。

文章图片
#hive#mapreduce#spark
【Hive】Windows 使用 Docker Compose 搭建 Hive 4.1.0 + MySQL 持久化环境

记录在 Windows 本机通过 Docker Compose 搭建 HiveServer2、Hive Metastore 和 MySQL Metastore DB,并实现 Hive 元数据与表数据持久化的本地学习环境。

文章图片
#hive#windows#docker
【Hive】 九、 复杂数据类型:ARRAY / MAP / STRUCT 与嵌套展开

系统讲解 Hive 三种复合数据类型(ARRAY / MAP / STRUCT)的定义、访问语法、嵌套用法,以及配套的 UDTF 函数(explode / posexplode / LATERAL VIEW)与 Spark 3.0+ 的 CROSS JOIN UNNEST 标准语法对比

文章图片
#hive#hadoop#数据仓库
    共 32 条
  • 1
  • 2
  • 3
  • 4
  • 请选择