logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

基于完全分布式模式部署Hadoop(详细版)

本文详细介绍了Hadoop完全分布式模式的部署过程。主要内容包括:1)虚拟机环境搭建,包括创建3个CentOS虚拟机、配置网络和SSH免密登录;2)JDK安装与环境变量配置;3)Hadoop集群部署,包括配置文件修改、环境变量设置、集群启动与验证;4)通过词频统计案例演示MapReduce程序运行。文章提供了从虚拟机创建到Hadoop集群部署的完整步骤,特别强调了配置细节和常见问题的解决方法,适合

文章图片
#分布式#hadoop#大数据 +1
Spark部署(详细版)

本文详细介绍了Spark集群的部署过程,主要包括以下步骤:1.下载并解压Spark安装包;2.修改配置文件spark-env.sh;3.配置workers文件;4.解决节点文件缺失问题;5.启动Spark集群;6.运行示例程序测试。文章特别强调了部署过程中可能遇到的常见错误及解决方法,如workers文件路径错误、节点Spark目录缺失等问题,并提供了详细的解决方案。最后通过运行SparkPi示例

文章图片
#spark#大数据#分布式
基于Spark RDD实现电商用户购买行为数据分析

本文介绍了基于Spark RDD实现电商用户购买行为数据分析的全流程。项目对原始购买日志进行数据清洗(过滤无效订单、去重)、标准化处理(统一时间/金额格式)和多维度聚合分析(按用户和商品类别统计消费金额、购买件数等指标)。通过Spark Shell分步执行数据加载、脏数据过滤、格式转换、维度扩展和聚合计算,最终将分析结果保存到本地文件。完整代码包含详细注释,适合Spark初学者学习RDD数据处理的

文章图片
#spark#大数据#分布式 +2
到底了