logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

流批一体场景下的数据仓库表命名规范

df, 按日分区,每日全量,按照业务主键(比如订单表的订单号),分区内业务主键唯一,跨分区数据会重复,一般不使用。_di,按日分区,每日增量,按照业务主键(比如订单表的订单号),全表业务主键唯一 (最常用)_multi_di,按日分区,每日增量,按照业务主键+状态(比如订单表的订单号),当日唯一。_du_di,按日分区,每日增量,按照业务主键+最新状态(比如订单表的订单号),当日唯一。dwd_vi

#数据仓库#开发语言
Spark笔记

Spark工作流程 client提交任务,创建driver进程并初始化Spark ContextSpark Context向Cluster Manager申请资源Cluster Manager选择合适的work节点创建executor 进程executor向driver注册并等待分配taskSpark Context构建DAG,拆分stage并分配task set 到executorexecuto

#spark#大数据
数据仓库建设核心:我们为什么坚持分层与建模

基本保持数据原貌,结构与业务系统基本一致。通常仅做简单的清洗(如删除明显异常数据)和字段标准化(如字符集统一)。支持。

#java#大数据#开发语言
到底了