
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
mapreduce工作原理
MapReduce 是一种分布式计算模型,用于处理大规模数据集。它的核心思想是将一个复杂的计算任务分解为多个简单的任务(Map 和 Reduce),并在分布式集群上并行执行。
配置spark
然后tar -zxvf 你的spark安装包的完整名字 -C /opt/module,进行解压。例如我的spark完整名字是spark-3.1.1-bin-hadoop3.2.tgz,所以我要输入的命令是。在输入 echo $PATH回车,出现spark-local/bin:/opt/module/spark-local/sbin说明我们已经配置好spark的环境变量了。自己新建一个存放修改spa
hadoop的常用指令
scp:它可以实现服务器与服务器之间的数据拷贝。说明(1)r表示递归拷贝。如果要拷贝的是文件夹,就把文件夹下的内容都拷贝(2)要拷贝的文件路径/名称(3)目的地用户@主机:目的地路径/名称现在的目标是:要把hadoop100上的jdk文件夹拷贝到hadoop101中的相同的目录下。我们一起看具体操作:1. 启动虚拟机。把hadoop100和hadoop101都启动。2. 进入到hadoop1003
Spark集群搭建之Yarn模式
进入/opt/module/spart-yarn/sbin,运行: ./start-all.sh 和 ./start-history-server.sh。在输入 echo $PATH回车,出现spark-local/bin:/opt/module/spark-local/sbin说明我们已经配置好spark的环境变。4.修改spark配置。
到底了







