logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【maap-analysis】spark离线数仓项目完整的开发流程

本文介绍了一个基于Spark的大数据处理项目架构,采用单项目多模块模式,主要使用Scala+Spark RDD+Spark DataSet技术栈。项目包含工具类准备、数据访问层、业务流程控制、业务逻辑开发和结果输出等模块。重点实现了Spark环境初始化工具类、线程安全的EnvUtil封装、业务数据访问Dao层,以及MAAP和BSMS两个核心业务的处理流程。项目通过RDD操作实现数据预处理、端口匹配

#spark#大数据#分布式 +1
【第五站】集群组件一键启动/关闭脚本(Hadoop/YARN + Hive + Spark)

摘要: 本文介绍了一个用于管理Hadoop/YARN+Hive+Spark集群的一键启停脚本。脚本支持start/stop命令,严格按照组件依赖顺序执行操作,包含启动状态检测功能。关键特性包括:环境变量检查(HADOOP_HOME/SPARK_HOME/JAVA_HOME)、权限控制要求(必须使用hadoop用户执行)、带状态检测的启停函数、以及详细的执行日志输出。脚本按照HDFS→YARN→Hi

#hadoop#hive#spark +2
到底了