logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

数据仓库:后台服务器就十几张表,为什么要建几十张表的数仓?

首先,数据仓库采用分布式存储,比如 HDFS 是分布式文件系统,HBase、MongeDB 等也是分布式数据库,支持横向扩展,只要增加服务器,理论上可以支持无限存储。其实,打一个不恰当的比方,数据仓库分层架构就好比预制菜,预制菜提前把你想要吃的菜配料都准备好,你只管选你喜欢的预制菜,下锅蒸煮即可,速度自然比你一步步从头自己做快多了。毕竟,天下没有白吃的午餐。而数据仓库的设计则是为数据分析而来,它能

#数据仓库
数据仓库:分层架构与维度建模

性能优化:在Hive中使用分区、ORC格式和压缩(如Snappy),减少I/O。查询时间∝数据量分区数查询时间 \propto \frac{数据量}{分区数}查询时间∝分区数数据量​。数据治理:添加元数据管理(如Hive Metastore),确保表结构一致。常见陷阱:避免过度规范化(雪花模式在Hive中可能慢);监控ETL任务。总结:分层架构和维度建模是数仓设计的基石。基于Hive实现时,优先星

#数据仓库
Spark系列:Spark 读取 CSV 文件设置 option 参数详解

spark 在读取 csv 文件时,可能会涉及到很多参数设置,这篇文章总结了 option 里面的参数,希望能够对你有所帮助。

#spark
Spark系列:Spark SQL 之 RDD、DataFrame 和 Dataset 如何选择

在什么时候该选用 RDD、DataFrame 或 Dataset 看起来好像挺明显。前者可以提供底层的功能和控制,后者支持定制的视图和结构,可以提供高级和特定领域的操作,节约空间并快速运行。DataFrame 和 Dataset,或 RDD API,按你的实际需要和场景选一个来用吧!

#spark
Spark系列:Spark 集群安装部署

Spark 集群和 Hadoop 类似,也是采用主从架构,Spark 中的主服务器进程就叫 Master(standalone 模式),从服务器进程叫 Worker。将 spark-2.4.7-bin-hadoop2.7.tgz 安装包上传到 node-01 的 /root 目录下,并将其解压。创建软连接的原因是 hadoop/sbin 目录和 spark/sbin 目录脚本可能命名相同,导致执行

#spark
Iceberg系列:Iceberg作为数据湖基建的5大特性

Iceberg 旨在与所有主流云存储配合使用,此外,Iceberg 还可以轻松与 Spark、Presto、Trino 和 Hive 等数据处理引擎集成。

Hadoop系列:MapReduce shuffle 过程详解

MapReduce 计算模型主要由三个阶段构成:Map、shuffle、ReduceMap 负责数据的拆分,将原始数据转化为 <key,value> 键值对Reduce 负责数据的聚合,将具有相同 key 值的 value 进行处理后再输出新的 <key,value> 键值对作为最终结果为了让 Reduce 可以并行处理 Map 的结果,必须对 Map 的输出进行一定的排序与分割,然后再交给对应的

#hadoop#mapreduce
Hadoop系列:HDFS 的内存存储是什么?

首先,我们来了解一下到底什么是 “内存存储”?那还用说嘛,当然就是使用内存来存储数据的方式咯!是的,在 HDFS 中,“内存存储” 就是我们常听到的 "我们可以在 HDFS 上创建某个文件时设定它的存储模式为 “LAZY_PERSIST” 模式,如此一来,后续在这个文件上所追加的所有数据都会被直接保存在对应数据节点的内存上。而使用内存来作为数据的存储介质的好处想必就不用我多说了,但同时在内存上保存

#hadoop
Hadoop:HDFS 集群环境搭建

HDFS 集群由一个主/从架构组成,单个运行 NameNode 进程的服务器为主节点服务器,多个运行 DataNode 进程的服务器为从节点服务器。

#hadoop#hdfs
大数据开发之序列化与反序列化技术选型

互联网的产生带来了机器间通讯的需求,而互联通讯的双方需要采用约定的协议,序列化和反序列化属于通讯协议的一部分。通讯协议往往采用分层模型,不同模型每层的功能定义以及颗粒度不同,例如:TCP/IP协议是一个四层协议,而 OSI 模型却是七层协议模型。在 OSI 七层协议模型中展现层(Presentation Layer)的主要功能是把应用层的对象转换成一段连续的二进制串,或者反过来,把二进制串转换成应

#大数据
    共 47 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择