logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【数据结构与算法 | 灵神题单 | 前后指针(链表)篇】力扣19, 61,1721

front节点提前走k - (k - (n + 1))步,然后front,last一起走,直到front==null为止,此时last刚好停在倒数第n+1个节点上。简单的一个数学问题,假设这条链表的长度是k,我们要删除的是链表的倒数第n个节点。last节点走几步才能到倒数第n+1个节点呢?k - (n + 1)步。要删除倒数第n个节点,其实就是要找到倒数第n+1个节点。给你一个链表,删除链表的倒数

文章图片
#链表#leetcode#算法
【大数据学习 | 面经】yarn三种调度方式

在YARN的(Yet Another Resource Negotiator)集群中,资源调度器负责管理和分配集群中的计算资源给不同的应用。yarn支持多种资源调度模式,以适应不同类型的作业和用户需求。以下是yarn集群模式下的三种主要资源调度模式。

文章图片
#大数据#yarn#oracle +2
【大数据学习 | 面经】Spark的四种join方式

在Spark中,join操作用于合并两个数据集(如dataFrame和Dataset),其原理依赖于分布式计算的特性。Spark的join主要通过不同的连接策略来实现,选择哪种策略取决于多种因素,包括参数连接的数据集大小,是否进行了广播,是否有共同的分区分区键等。

文章图片
#大数据#学习#spark
【大数据学习 | 面经】Spark为什么比MR计算更快

(cache算子可以将数据缓存在内存中,避免大量的重复计算),减少对磁盘I/O的依赖。对于需要反复迭代的数据处理任务,如机器学习算法,这种特性可以极大提高效率。综上所述,Spark之所以能在很多场景下表现出优于MR的速度,是因为它结合了内存计算的优势、先进的任务调度机制、精简的操作流程、JVM级别的性能优化以及良好的开发体验。MR由于其固有的架构,在某些情况下会强制执行额外的MapReduce阶段

文章图片
#大数据#spark
【大数据学习 | Spark调优篇】数据序列化(kryo序列化)

使用自定义类型时需要预先注册好要序列化的自定义的类。

文章图片
#大数据#spark#oracle +3
【大数据学习 | Spark-SQL】定义UDF和DUAF,UDTF函数

一般指的是用户自己定义的单行函数。一进一出,函数接受的是一行中的一个或者多个字段值,返回一个值。比如MySQL中的,日期相关的dateDiff函数,字符串相关的substring函数。定义一个Scala函数,并将其注册为UDF。示例指的是用户自定义的聚合函数,多进一出,比如MySQL中的,count函数,avg函数。以学生信息为主进行统计,所有人员的年龄的总和或者每个性别的年龄的平均值/***//

文章图片
#大数据#spark#oracle +2
【大数据学习 | Spark-Core】Spark的kryo序列化

由于大多数Spark计算的内存性质,Spark程序可能会受到集群中任何资源(CPU,网络带宽或内存)的瓶颈。通常,如果内存资源足够,则瓶颈是网络带宽。数据序列化,这对于良好的网络性能至关重要。在Spark的架构中,在网络中传递的或者缓存在内存、硬盘中的对象需要进行序列化操作。比如:1)分发给Executor上的Task2)广播变量3)Shuffle过程中的数据缓存等操作,序列化起到了重要的作用,将

文章图片
#大数据#spark#oracle +3
【大数据学习 | Spark-Core】Spark的分区器(HashPartitioner和RangePartitioner)

工作的过程中我们会遇见数据分类的情况,想要根据自己的需求定义分区的规则,让符合规则的数据发送到不同的分区中,这个时候我们就需要自定义分区器了。定义分区器,让数据发送到不同的分区,从而不同的task任务输出的文件结果内容也不同# 自己创建数据data/a.txt# 需求就是将数据按照规则进行分发到不同的分区中# 存储的时候一个文件存储hello其他的文件存储tom jack分区器的定义需要实现分区器

文章图片
#大数据#spark#sqlite +4
【大数据学习 | Spark-Core】Spark中的join原理

join是两个结果集之间的链接,需要进行数据的匹配。演示一下join是否存在shuffle。,会发生shuffle。但分区数量不变。

文章图片
#大数据#spark#oracle +4
    共 17 条
  • 1
  • 2
  • 请选择