logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

hive----静态、动态分区表

分区------处理海量数据根据数据文件结构考虑分门别类保存(大化小),使用分区,创建分区表,提高查询效率指定分区字段,分区字段被称为伪列。数据文件中没有和分区字段对应的数据分区可以分为一级分区(分区字段是一个字段),二级分区(分区字段是二个)。。。。。。分区可以是静态分区(导入数据时 ,指定分区字段的值)动态分区(导入数据时,不需要指定分区字段的值,由系统根据数据文件的情况自行判断)。

#hive#hadoop#数据仓库
hive---案例11-1 影评大数据分析

(1)将表answer7_A中的type字段进行裂变,将结果保存到表answer8_A中。(2)表answer7_A按照电影类型中是否包含Comedy和按照评分≥4.0作为Where过滤条件,按照评分作为排序条件进行查询,将结果保存到表answer7_B中。lcase函数把字段的值转换为小写。12.统计最喜欢看电影(影评次数最多)的那位女性评分最高的10部电影的平均影评分(观影者、电影名、影评分)

#数据分析#数据仓库#数据库
hive-----广电大数据分析

1.创建存储格式为TextFile的观看历史表text_see和用户信息表text_user(用于存储原始数据)。并创建存储格式为ORC的表orc_see和orc_user。12.对orc_see表按照用户Group By聚合,然后统计组内的时长即可。3.用户信息文件userevents.txt存储在本地系统/opt/datas目录下,将其导入表text_user中。5.将表text_user中数

#hive#hadoop#数据仓库
hive---案例11-1 影评大数据分析

(1)将表answer7_A中的type字段进行裂变,将结果保存到表answer8_A中。(2)表answer7_A按照电影类型中是否包含Comedy和按照评分≥4.0作为Where过滤条件,按照评分作为排序条件进行查询,将结果保存到表answer7_B中。lcase函数把字段的值转换为小写。12.统计最喜欢看电影(影评次数最多)的那位女性评分最高的10部电影的平均影评分(观影者、电影名、影评分)

#数据分析#数据仓库#数据库
到底了