logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

数据仓库建模

拉链表,记录每条信息的生命周期,一旦一条记录的生命周期结束,就重新开始一条新的记录,并把当前日期放入生效开始日期。如果房前信息至今有效,在生效日期中填入一个极大值(如 9999-12-31)。

#大数据#spark#分布式
Spark 部署模式

所谓 Local 模式,就是不需要其他任何节点资源就可以在本地执行 Spark 代码的环境,一般用于教学、调试、演示等。

#spark#大数据#分布式
Spark Streaming 简介

特性DStream (微批次)编程模型基于 RDD 的低级 API基于 DataFrame/Dataset 的高级声明式 APIAPI 级别较低级,需手动处理状态、窗口较高级,内置对事件时间、窗口、水位线的支持性能优化无自动优化利用 Spark SQL 的 Catalyst 优化器和 Tungsten 执行引擎延迟秒级(微批次)可达毫秒级(微批次),还有更低延迟的连续处理模式语义保证At-leas

#spark#大数据
Flink Checkpoint 和 Spark Checkpoint 的区别

更像一个“它主要目的是,避免因链路过长导致的性能问题或 StackOverflowError。它是一个** coarse-grained(粗粒度)** 的、的、的容错机制。:是一个“它是 Flink,用于在发生故障时,将整个分布式数据流状态恢复到一致性的检查点,实现或 At-Least-Once 语义。它是一个的、的、的容错机制。简单来说,Spark Checkpoint 是为了解决 RDD 带来

#flink#spark#大数据
Spark SQL 简介

Spark SQL 是 Spark 用于结构化数据处理的模块,对于开发人员来讲,Spark SQL 可以简化 RDD 的开发,提高开发效率,且执行效率非常快,所以实际工作中,基本上采用的就是 Spark SQL。Spark SQL 为了简化 RDD 的开发,提高开发效率,提供了两个编程抽象,类似 Spark Core 中的 RDD。即 DataFrame 和 DataSet。

#spark#sql#大数据
Spark 运行架构及相关概念

Spark 框架的核心是一个计算引擎,整体来说,它采用了标准的 master-slave 结构。上图中的 Driver 表示 master ,负责管理整个集群中的作业任务调度;Executor 则是 slave,负责实际执行任务;

#spark#架构#大数据
Spark shuffle 和 MapReduce shuffle 的区别

shuffle 的字面意思是洗牌、混洗的意思,就是把一组有规律的数据尽量打乱成无规律的数据。但在 MapReduce 中 Shuffle 更像是洗牌的逆过程,其将 Map 端输出的混乱数据按指定规则划分成有一定规律的数据,以方便 Reduce 端接收处理。MapReduce 的工作阶段主要可有分为 Map 端和 Reduce 端两个部分。

#spark#mapreduce#大数据
Starrocks 简介

Starrocks 是新一代极速全场景 MPP 数据库。StarRocks 采用分布式架构,对数据表进行水平划分并以多副本存储。集群规模可以灵活伸缩,能够支持 10PB 级别的数据分析;支持 MPP 框架,并行加速计算;支持多副本,具有弹性容错能力。StarRocks 采用关系模型,使用严格的数据类型和列式存储引擎,通过编码和压缩技术,降低读写放大;使用向量化执行方式,充分挖掘多核 CPU 的并行

#数据库#大数据#数据仓库
Starrocks 数据模型

目前 Starrocks 根据摄入数据和实际存储数据之间的映射关系,分为明细模型(Duplicate key)、聚合模型(Aggregate key)、更新模型(Unique key)和主键模型(Primary key)。

#前端#java#javascript
Java HashMap、Hashtable、HashSet、TreeMap 之间的区别

HashSet 底层是基于 HashMap 实现的,除了 clone()、writeObject()、readObject()是 HashSet 自己实现的,其他方法都是直接调用 HashMap 中的方法。这些方法都是基于红黑树数据结构的属性实现的,红黑树保持平衡状态,从而保证了搜索操作的时间复杂度为 O(log n),这让 TreeMap 成为了处理有序集合搜索问题的强大工具。综上所述,相比于

#java#开发语言#jvm
    共 12 条
  • 1
  • 2
  • 请选择