
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
流批一体场景下的数据仓库表命名规范
df, 按日分区,每日全量,按照业务主键(比如订单表的订单号),分区内业务主键唯一,跨分区数据会重复,一般不使用。_di,按日分区,每日增量,按照业务主键(比如订单表的订单号),全表业务主键唯一 (最常用)_multi_di,按日分区,每日增量,按照业务主键+状态(比如订单表的订单号),当日唯一。_du_di,按日分区,每日增量,按照业务主键+最新状态(比如订单表的订单号),当日唯一。dwd_vi
Spark笔记
Spark工作流程 client提交任务,创建driver进程并初始化Spark ContextSpark Context向Cluster Manager申请资源Cluster Manager选择合适的work节点创建executor 进程executor向driver注册并等待分配taskSpark Context构建DAG,拆分stage并分配task set 到executorexecuto
数据仓库建设核心:我们为什么坚持分层与建模
基本保持数据原貌,结构与业务系统基本一致。通常仅做简单的清洗(如删除明显异常数据)和字段标准化(如字符集统一)。支持。
到底了







