1. 实战概述

  • 本实战在VMware中搭建Spark分布式集群,完成环境配置、节点分发与服务启动。通过Spark Shell实现词频统计,使用spark-submit提交Pi计算任务,验证client与cluster模式差异,并借助WebUI监控作业运行,全面掌握Spark集群的部署、应用提交与管理流程。

2. 实战步骤

2.1 Spark集群拓扑结构

在这里插入图片描述

2.2 下载Spark安装包

在这里插入图片描述

2.3 主节点上安装配置Spark

在这里插入图片描述

2.4 从主节点分发到从节点

在这里插入图片描述

2.5 启动Spark集群

在这里插入图片描述

2.6 访问Spark WebUI

在这里插入图片描述

2.7 初试Spark Shell

在这里插入图片描述

2.8 提交Spark应用程序

在这里插入图片描述

2.9 关闭Spark集群

  • 执行命令:stop-all.sh
    在这里插入图片描述

3. 实战总结

  • 本次实战在VMware环境下成功搭建了基于Standalone模式的Spark集群,完成了从环境准备、安装配置、分发部署到启动验证的全过程。通过配置spark-env.shworkers文件,明确了主从节点角色,并利用scp命令将主节点配置同步至slave1和slave2。启动集群后,通过JPS进程检查和Spark WebUI(http://master:8080)确认服务正常运行。实践了Spark Shell下的RDD与SQL词频统计任务,并使用spark-submit提交Pi计算应用,对比了client与cluster两种部署模式的区别。整个过程掌握了Spark分布式集群的核心配置与管理方法,为后续大数据开发奠定了坚实基础。

更多推荐