logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从零到一构建数据仓库

以下的讲解是基于电商行业构建离线数据仓库熟悉业务:电商行业中包含的业务有:加购商品,下订单,支付订单,订单商品发货,订单商品收货等等。熟悉业务数据:这里举一个下单的业务。在业务数据库中(MySQL)中,相关的表有订单表,订单明细表。这个订单中可能有对应的活动,优惠等等熟悉日志数据:日志数据一般不存储在业务数据库中,但是我么数仓分析需要用户行为数据。对于我们的数仓分析,需要什么样的日志数据。

#数据仓库
OLTP数据库&&OLAP数据仓库

OLAP数据仓库,数据的高范式虽然可以减低数据的冗余度,但是对于多表关联的效率降低了,并且同一个业务过程中的存在多个中心点,下单可以关联商品表,用户表,但是商品表和用户表也可以再关联。OLAP数据仓库中处理的数据, 各个OLTP数据库的数据 + 用户行为日志 的数据,所以对于OLAP数据仓库,数据是大批量的,非频繁的,高吞吐,并且允许一定的延迟。站在数据分析的角度而言,用户的浏览路径,用户的页面浏

#数据库#数据仓库
大数据之数据治理

数据治理是一种系统化的方法,可以有效管理企业中数据的质量,一致性,安全性和完整性。帮助企业有效的组织收集、存储、访问和利用数据。数据治理方向说明数据质量确保数据的准确性,一致性和可用性,降低错误和冗余数据规范统一数据标准规范,提高沟通效率和数据利用价值数据安全设定数据访问权限,防止未经授权的访问和泄露数据完整性维护数据的完整性,确保不受损坏和误操作影响数据策略和流程制定和执行数据治理策略,明确数据

#大数据
Hive 数据仓库技术全解(一):环境搭建、服务配置与核心DDL/DML/DQL基础

本文是《Hive数据仓库技术全解》系列开篇,系统讲解Hive环境搭建、服务配置与核心HQL语法。内容涵盖:Hive与Hadoop关联配置、MySQL元数据库对接、HiveServer2远程服务配置;数据类型(含ARRAY/MAP/STRUCT集合类型);DDL库表管理(内/外部表、分区表);DML数据导入导出(LOAD/INSERT/EXPORT);DQL基础查询(JOIN、分组聚合、排序)。适合

文章图片
#数据仓库#hive#hadoop
Hive 数据仓库技术全解(二):HQL高级函数(窗口函数、UDF/UDAF/UDTF、炸裂函数与行列转换,分区/分桶)

本文是《Hive数据仓库技术全解》系列第二篇,重点讲解HiveQL高级特性。主要内容包括:1)字符串、日期和流程控制等内置函数;2)高级聚合与炸裂函数(collect_list/set、explode等),通过电影分类统计案例展示实际应用;3)窗口函数详解,涵盖语法结构、缺省规则和常用函数(聚合计算、位移函数、排名函数等),并给出累计消费和下单间隔的实战案例;4)行列转换技术;5)分区与分桶设计策

#数据仓库#hive#hadoop
Hive 数据仓库技术全解(三):企业级生产调优(聚合优化、数据倾斜优化、小文件合并、join优化等

本文系统梳理了Hive在企业生产环境中的核心优化技术,包括YARN资源配置、执行计划分析、Map-Side预聚合、四种Join策略及其自动转换机制、三种数据倾斜解决方案(Map-Side/Skew-Groupby/Skew Join)、并行度调优、小文件合并策略等。重点剖析了聚合优化、Join优化(Reduce/Map/Bucket/SMB)、数据倾斜处理等关键场景,并详细介绍了CBO、谓词下推、

#sql#hive#大数据 +1
Hive on Spark 企业级调优(一):集群与引擎配置优化

Hive on Spark 性能远超 MR,但配置不当照样浪费资源。本文从集群规划到 Yarn、再到 Executor/Driver,逐层推导内存与核数配置,讲透动态分配与 Shuffle 服务,不堆参数只讲逻辑,附运行流程与内存模型图。系调优系列第 1 篇。

#hive#spark#hadoop +2
Hive on Spark 企业级调优(二)SQL 优化(上):执行计划与常规优化

本篇从 Explain 执行计划入手,逐层拆解 Hive on Spark 的 SQL 常规优化:Map-side 预聚合、分区/列裁剪、谓词下推、四种 Join 算法(Common → Map → Bucket → SMB)、小文件治理、并行度调参及 CBO 成本优化。每个优化点均附原理、参数与实战 SQL,帮你把 Shuffle 数据量和 I/O 开销压到最低。

#hive#spark#sql
Hive on Spark 企业级调优(二)SQL 优化(下):数据倾斜与进阶调优

本文摘要: 针对SQL执行后可能出现的数据倾斜问题,文章提出系统性解决方案。首先通过五步法快速定位倾斜问题(观察UI、分析Key分布、判断场景类型、选择方案、验证效果)。针对三种典型场景提出SQL改写方案:1)Group By倾斜采用两阶段聚合(加盐打散+去盐合并);2)Join倾斜采用分离倾斜Key或加盐打散;3)空值倾斜通过随机分配处理。文章还介绍了参数调优方案,包括开启AQE自适应执行、调整

#hive#spark#sql
Hive 数据仓库技术全解(一):环境搭建、服务配置与核心DDL/DML/DQL基础

本文是《Hive数据仓库技术全解》系列开篇,系统讲解Hive环境搭建、服务配置与核心HQL语法。内容涵盖:Hive与Hadoop关联配置、MySQL元数据库对接、HiveServer2远程服务配置;数据类型(含ARRAY/MAP/STRUCT集合类型);DDL库表管理(内/外部表、分区表);DML数据导入导出(LOAD/INSERT/EXPORT);DQL基础查询(JOIN、分组聚合、排序)。适合

文章图片
#数据仓库#hive#hadoop
    共 12 条
  • 1
  • 2
  • 请选择