logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Hive | 分区与分桶

Hive中的分区和分桶是优化查询性能的两大核心技术。分区通过按业务维度(如日期、地区)划分数据目录,实现快速过滤;分桶则基于列值的哈希将数据均匀分布到固定数量的文件中,优化JOIN、采样等操作。分区适用于低/中基数字段,分桶适合高基数字段。实际应用中常先分区后分桶,形成多维优化结构。分区裁剪减少I/O,分桶提升计算效率,二者配合可避免全表扫描。但需注意避免过度分区导致小文件问题,以及分桶列选择不当

#hive#大数据#数据仓库
Hive | 排序查询【order by/cluster by/distribute by/sort by】

Hive SQL提供了四种排序方式:order by(全局排序,单reducer)、cluster by(分区排序,同一字段)、distribute by + sort by(分区和排序分离)以及sort by(局部排序)。order by适用于小数据量全局排序,需注意strict模式下需用limit限制;cluster by实现分区内升序排序;distribute by负责分区,sort by负

#hive#hadoop#数据仓库
Hive | 行列转换

本文介绍了Hive中行转列和列转行的常用函数及实现方法。行转列部分讲解了concat、concat_ws字符串拼接函数,以及collect_list、collect_set聚合函数,并通过实例展示了多行转单列的实现过程。列转行部分重点解析了explode函数和lateral view侧视图的使用,详细说明了如何将单列数据转换为多行数据。文章提供了完整的SQL示例代码和运行结果图示,帮助读者理解Hi

#hive#hadoop#数据仓库
Hive | json数据处理

本文介绍了两种Hive解析JSON数据的方法:get_json_object和json_tuple。get_json_object每次只能提取JSON中的一个字段值,而json_tuple可以一次提取多个字段值,属于UDTF函数。文章通过示例展示了如何从包含设备名称、类型、信号强度和时间等字段的JSON数据中提取信息,并最终转换为Hive表的列格式。两种方法都能有效解析JSON字符串,其中json

#hive#json#hadoop
2022第五届“泰迪杯”数据分析技能赛-B题-银行客户忠诚度分析(下)

2022第五届泰迪杯数据分析技能赛B题-银行客户忠诚度分析 数据分析比赛

#数据分析#python
Spark分布式计算框架介绍

大白话介绍了Spark的核心概念和运行机制。首先概述了Spark作为高效分布式计算框架的优势,重点阐述了RDD(弹性分布式数据集)的特性及其转换/动作算子分类。文章详细分析了RDD的两种依赖关系(窄依赖和宽依赖)及其对性能的影响,并深入讲解了Spark程序架构和三种运行模式(Local、Standalone、Yarn)。最后通过词频统计示例,说明了Spark从逻辑查询计划到物理查询计划的转换过程,

文章图片
#spark#大数据#分布式
Hadoop分布式计算框架【MapReduce】

摘要:MapReduce是一种用于大规模数据并行处理的编程模型,它将计算任务分为Map和Reduce两个阶段,通过移动计算而非数据实现并行处理。MapReduce适用于离线批处理场景。其工作原理包括数据切分、Map任务处理、Shuffle阶段和Reduce任务汇总。典型应用如WordCount词频统计,通过哈希取模确保相同Key分发到同一Reduce节点。但MapReduce因大量磁盘I/O和网络

文章图片
#hadoop#mapreduce#大数据
R语言课程论文-飞机失事数据可视化分析

当地时间,24小时制,格式为hh:mm。结构号或序列号/线号或机身号。事故发生日期(年-月-日)事故前飞行的全部或部分航线。由飞机操作员指定的航班号。国际民航组织对飞机的登记。航空公司或飞机的运营商。出课程论文-多元统计分析论文、R语言论文、stata计量经济学课程论文(论文+源代码+数据集)

#r语言#数据分析#数据可视化
2022全国大学生数据分析大赛A题-医药电商销售数据分析

1)本次比赛的代码过于冗杂,很多地方都可以进行优化2)论文整体质量比上一次参加稍有进步最后插个小广告hhh(适合数据分析初学者&入门者)(出售本次比赛的论文、源程序、支撑材料,仅供学习使用,仅供学习使用,仅供学习使用。

#python#数据分析#pandas +1
软考中级数据库系统工程师-第6-7章 数据库技术基础&关系数据库

3)广义笛卡尔积:两个元数分别为m和n的关系R和S的广义笛卡尔积是一个(m+n)列的元组的集合。PS:三方联系和聚合的区别:三方联系必须要三方实体同时参与,而聚合是有先后顺序的,两个实体先产生联系,再与第三个实体产生联系。也称存储模式,是数据物理结构和存储方式的描述,是数据在数据库内部的表示方式。Y,那么对于任意两个相同的X,所对应的Y一定是相同的。是数据库中全部数据的逻辑结构和特征的描述,只设计

文章图片
#数据库#sql
    共 43 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择