logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

关于传统数据仓库的介绍

传统数据仓库是一个面向主题的、集成的、非易失的、随时间变化的数据集合,用于支持管理决策过程。该定义最早由数据仓库之父Bill Inmon提出,并被业界广泛接受。简而言之,数据仓库不是用来处理日常交易操作的系统(如ERP、CRM),而是专门用于整合来自多个异构系统的数据,经过清洗、转换和建模后,为报表、分析和商业智能(BI)提供统一、一致、高质量的数据服务。传统数据仓库作为企业数字化转型的重要基石,

文章图片
#数据仓库
什么是大数据数仓

大数据数仓是指基于大数据技术栈构建的数据仓库系统,它能够高效存储、管理并分析 PB 级甚至 EB 级的结构化、半结构化和非结构化数据,支持实时或近实时的复杂查询与深度分析,服务于企业的决策支持、运营优化和人工智能应用。与传统数据仓库相比,大数据数仓不仅“更大”,更强调“更快、更灵活、更多样”。✅ 核心能力概括:高容量 + 高并发 + 多模态 + 实时性 + 可扩展性优势说明超强扩展性可轻松扩展至数

文章图片
#大数据#数据库
传统数仓与大数据数仓的区别

传统数仓(Traditional Data Warehouse)传统数仓是20世纪80年代末至90年代发展起来的一种用于支持决策分析的系统架构。它通常基于关系型数据库(如Oracle、IBM DB2、Teradata等),采用ETL(Extract, Transform, Load)流程,将来自不同业务系统的结构化数据整合到一个集中的、主题导向的数据仓库中,以支持复杂的报表和联机分析处理(OLAP

文章图片
#数据仓库#大数据
数据仓库整合层之 SCV

关键点说明🎯目标明确打破数据孤岛,实现“一人一档”🔗承上启下上接 ODS/DWD,下供 DWS/ADS 和业务系统💡赋能业务是 CDP、精准营销、智能推荐的基础🛠️技术融合涉及 ETL、ID-Mapping、标签系统、实时计算✅建议:企业在建设数据仓库时,应尽早规划 SCV 能力建设。可以从简单的“统一会员 ID”起步,逐步扩展到全渠道客户画像,最终构建真正的“以客户为中心”的数据驱动体系

文章图片
#大数据#面试#职场和发展
大数据数仓分层架构详解

数据仓库分层是一种将数据处理流程按照逻辑阶段进行划分的设计方法。职责分离:不同层级负责不同的任务,便于团队协作。数据质量可控:逐层加工,层层校验,保障最终数据准确性。复用性强:中间层数据可被多个下游应用共享。易于维护和扩展:局部修改不影响整体架构。ODS 层(操作数据存储层)DWD 层(数据明细层 / 明细事实层)DWS 层(数据服务层 / 汇总轻度聚合层)ADS 层(应用数据服务层 / 应用结果

文章图片
#大数据#架构
维度建模:数据仓库中的核心设计方法

维度建模是由 Ralph Kimball 等数据仓库专家提出的一种面向分析的数据库设计方法。它以“业务过程”为中心,通过直观、易于理解的方式组织数据,使非技术人员也能轻松进行数据查询和分析。与传统的规范化建模(如第三范式3NF)不同,维度建模强调可读性、查询性能和业务语义的清晰表达,更适合用于支持报表、仪表盘和即席查询等分析型应用。维度建模是构建现代数据仓库和商业智能系统的基石。它以业务为导向,通

文章图片
#spark#大数据#分布式
大数据数仓中的 DDL 与 DML:构建与操作数据的核心语言

DDL 用于定义或修改数据库结构,即“建什么”。它不涉及具体数据内容,而是关注表、视图、索引等对象的创建、修改和删除。CREATE:创建数据库、表、视图等ALTER:修改表结构(如添加字段)DROP:删除表或数据库TRUNCATE:清空表中所有数据(保留结构)🔍 举例:就像盖房子前的设计图纸 —— 先规划房间布局(数据库结构),再施工。对比项DDL(数据定义语言)DML(数据操作语言)核心作用定

文章图片
#大数据
深入浅出 HiveSQL:大数据分析的利器

HiveSQL(Hive Query Language,简称 HiveQL)是 Apache Hive 提供的一种类 SQL 查询语言。它允许用户使用类似于传统 SQL 的语法来查询存储在 Hadoop 分布式文件系统(HDFS)或其他兼容存储系统(如 Amazon S3)中的结构化或半结构化数据。尽管 HiveSQL 语法与标准 SQL 高度相似,但它并不是为实时事务处理设计的,而是专为批处理和

文章图片
#数据分析#数据挖掘
数据仓库中的行列转换:原理、应用场景与实现方案详解

行列转换行转列(Pivot / 透视)将某一字段的不同值作为新列名,把对应的度量值填充到对应位置,实现“多行 → 少行 + 多列”的结构变化。列转行(Unpivot / 反透视)将多个列的数据“堆叠”成两列(如属性名和属性值),实现“少行 + 多列 → 多行 + 少列”的转换。这类操作常见于从操作型数据库向分析型数据模型转化的过程中。特性行转列(Pivot)列转行(Unpivot)目的提升可读性,

文章图片
#数据仓库
Hive on Spark:加速大数据分析的新引擎

是指将 Apache Spark 作为 Hive 的执行引擎来运行 HiveQL 查询的一种模式。换句话说,用户仍然使用熟悉的 Hive 接口(如 Hive CLI、Beeline 或 HiveServer2)编写 SQL 查询,但这些查询不再由 MapReduce 执行,而是被编译成 Spark 任务,在 Spark 集群上并行执行。✅ 简单理解:“Hive 提供语法接口,Spark 提供执行动

文章图片
#hive#spark#数据分析
    共 69 条
  • 1
  • 2
  • 3
  • 7
  • 请选择