logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

混合云大数据平台搭建血泪史:从Spark到Sqoop,彻底打通本地集群与云端HDFS

本文记录了本地Spark集群与云端HDFS混合部署的实践过程,重点解决公网环境下Connection refused和UnresolvedAddressException问题。通过三节点本地集群(Spark+Hive+ZK)与云端单节点HDFS的组合,实现计算存储分离。关键方案包括:CLB转发NameNode RPC端口、ECS公网直连DataNode、最小Hadoop客户端安装保障Hive/Sq

#spark#hdfs#hadoop +4
Hadoop TeraGen 性能调优:如何选择最佳的 Map 数量?(附 5GB 实测数据)

摘要: Hadoop TeraGen性能测试表明,Map数量并非越多越好。在3节点集群上测试5GB数据(5000万条记录),当Map数量从2增加到8时,耗时稳定在约65秒;但超过16时,性能急剧下降,GC时间和调度开销显著增加。最佳Map数量为4~8个,过多Map会导致固定开销累积、GC压力和资源争用。调优建议包括从小规模开始试探、考虑硬件限制、避免盲目遵循经验公式。测试结论:性能调优需在资源、数

#hadoop#大数据
Hadoop TeraGen 调优:并行度与压缩的博弈——5GB 数据实测分析

本文通过实验分析了Hadoop TeraGen在5GB数据场景下开启Snappy压缩的性能影响。测试表明:在2-8个Map的最优并行度区间,压缩反而可能降低性能(如8Map时慢11秒),因压缩的CPU开销抵消不了I/O收益;但当Map数过多(16-40个)时,压缩能缓解I/O压力,提升性能(如40Map快24.5秒)。实验还解释了"先卡顿后顺畅"现象源于压缩器初始化延迟。结论建议:小数据量优先不压

#hadoop#大数据
Hadoop TeraGen 性能调优:如何选择最佳的 Map 数量?(附 5GB 实测数据)

摘要: Hadoop TeraGen性能测试表明,Map数量并非越多越好。在3节点集群上测试5GB数据(5000万条记录),当Map数量从2增加到8时,耗时稳定在约65秒;但超过16时,性能急剧下降,GC时间和调度开销显著增加。最佳Map数量为4~8个,过多Map会导致固定开销累积、GC压力和资源争用。调优建议包括从小规模开始试探、考虑硬件限制、避免盲目遵循经验公式。测试结论:性能调优需在资源、数

#hadoop#大数据
到底了