
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在hue执行"truncate table db_name.table_name"时报错,报错内容为"Error while compiling statement: FAILED: SemanticException [Error 10146]: Cannot truncate non-managed table db_name.table_name"外部表:hive只管理元数据,hdfs管理实
想将hive表中包含逗号的字段按逗号做分隔符进行分列操作。
一.需求调研(业务调研、技术调研)1.业务调研明确需求并经过需求评审后,调研相关系统的功能模块及系统运行流程,生成业务调研报告。2.技术调研系统与数据资源盘点,明确系统数据库选型、带宽、架构设计等,并基于相关系统进行数据探查,根据数据量及热度识别出核心字段及扩展字段。二.方案设计(架构设计、详细设计、应用设计)1.架构设计包括总体架构设计、数据上云设计、技术规范设计及方案的评审与修正。2.详细设计

整体实现思路:1.用户每天可能不止登陆一次,将登录日期去重,取出当日登陆成功的日期,row_number()函数分组排序并计数2.日期减去计数得到值3.根据每个用户count(值)判断连续登陆天数4.最后取连续登陆天数大于等于7天的用户示例:CREATE TABLE db_test.user_log_test(datestr string comment ‘日期’,uid string comme
数据仓库建设之数仓架构
flink sql实战案例
大致执行顺序:先执行from关键字后面的语句,明确数据的来源,它是从哪张表取来的。再进行on的过滤。之后join, 这样就避免了两个大表产生全部数据的笛卡尔积的庞大数据。接着执行where关键字后面的语句,对数据进行筛选。再接着执行group by后面的语句,对数据进行分组分类。然后执行select后面的语句,也就是对处理好的数据,具体要取哪一部分。最后执行order by后面的语句,对最终的结果
举个栗子????:批量删除2019-01-01到2020-09-03号范围内的分区alter table drop partition (ds<‘2020-09-03’,ds>‘2019-01-01’);
纯钧(ChunJun,原名FlinkX)框架学习







