
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
目录0- 描述1- 问题一0- 描述描述:时间序列–构造日期1- 问题一描述:直接使用SQL实现一张日期维度表,包含以下字段:create table if not exists dim_date (date_idstringcomment '日期(yyyymmdd)',datestrstringcomment '日期(yyyy-mm-dd)',date_name
目录0-面试题1-答案详细解析1.1-自我介绍1.2-到北京工作的医院1.3-SQL题,给一张城市和交易额表,一张城市对应省份表, 取出 省份 总 交易额大于 500 的 省份 的名字1.4-SQL题,基于刚才, 得出 省份 总 交易额 [0,500 ] , [500,1000 ] ,[1000,+oo ] 在以下三个区间的 省份 的 数量1.5-SQL题,还是基于刚才, 按从小到大的顺序得出每个
translate()函数详解0-需求1-数据分析2-总结0-需求删除某个字段中不需要的字符,如某字段为字符串,我需要删除字符串中所有的元音字符,怎么删除?这里举例:给出样例字符串"ABCDEFGHIOUUFEBCAADDEEII",我需要删除该字符串中的元音字符,也就是出现在该字段中包含"AEIOU"任意一个字符都需要删除掉。1-数据分析该需求的难点是需要去匹配"AEIOU"中的每一个字符,匹配
目录0-预热1-正题1.1-全量表1.2-增量表1.3-拉链表1.4-流水表2-总结0-预热我们先从几个物理概念入手理解什么是流量,存量,增量(1)存量:系统在某一时点时的所保有的数量;(2)流量:是指在某一段时间内流入/出系统的数量(3)增量:则是指在某一段时间内系统中保有数量的变化(4)增量=流入量–流出量(5)本期期末存量=上期期末存量+本期内增量1-正题一般公司只是简单分成 全量表,增量表
目录0- 描述0- 描述期望输出结果如下所示:12345...100参考答案:不借助其他任何外表,实现产生连续数值此处给出两种解法,其一:selectid_start+pos as idfrom(select1 as id_start,1000000 as id_end) mlateral view posexplode(split(space(id_end-id_start), '')) t a
目录1-什么是拉链表2-为什么要做拉链表2.1-如何使用拉链表3-拉链表的形成过程4-拉链表的制作过程4.1-初始化拉链表(首次独立执行)4.2-制作当日变动数据(包括新增,修改)每日执行4.3-先合并变动信息,再追加新增信息,插入到临时表中4.4-把临时表覆盖给拉链表5-总结1-什么是拉链表本文以订单拉链表为例进行详细讲解。2-为什么要做拉链表2.1-如何使用拉链表3-拉链表的形成过程4-拉链表
如何使用HQL分离字符串中的字符和数字0-需求1-数据分析2-总结0-需求如果数据中存在字符和数字混在一起的情况且放在一列中,此时需要将其中的数字数据和字符数据分开,分别单独成为一列,应该怎么做?如下数据:FLINK434354HADOOP67889HBASE500019KAFKA15999SQOOP13332HELLO57000SPARK13000需要将中文名称和数字单独提取出来,得到如下结果F
真实数仓sql面试题(一)
目录1- 指导思想2- 数据调研2.1- 业务调研2.2- 需求调研3- 架构设计3.1- 数据域的划分3.2- 构建总线矩阵4- 指标体系搭建4.1- 基本概念4.2- 操作细则5- 模型设计5.1- 数据分层5.2- 接入层(ods)5.3- 明细层(dwd)5.4- 汇总层(dws)5.5- 数据集市层(dwm)5.6- 应用层(app)6- 维度设计6.1- 维度设计基本方法6.2- 规范
目录1- Flume2- Fluentd3- Logstash4- Chukwa5- Scribe6- Splunk7- Scrapy1- FlumeFlume作为Hadoop的组件,是由Cloudera专门研发的分布式日志收集系统。尤其近几年随着Flume的不断完善,用户在开发过程中使用的便利性得到很大的改善,Flume现已成为Apache Top项目之一。Flume提供了从Console(控制







