logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Hadoop 核心架构与高可用性解析

Hadoop= 存储 + 资源管理 + 分布式计算集群配置示例:48核CPU / 256GB内存 / 每台24TB存储(36TB总容量)

#hadoop#架构#大数据
Hadoop 运维与故障排查

部分 reduce 任务执行极慢,大部分任务已经完成,个别任务卡在 99%。通过 YARN 查看每个 reduce 处理的数据量,发现某一个 reduce 接收的数据远大于其他任务。key 分布不均匀,大量相同 key 被打到同一个 reduce。业务侧预处理;加盐,给倾斜 key 增加随机前缀打散;小表 mapjoin,避免 shuffle;调整并行度。

#hadoop#运维#hdfs
蓝绿 + 灰度( 容器 )

两套完整环境,;风险点:一旦切过去,。:保留蓝、绿两套完整集群,,兼顾:新版本完整环境隔离 + 灰度小流量验证 + 秒级整体回滚能力。

#运维
Hadoop YARN 任务失败排查指南:从定位到解决

任务一直 ACCEPTED,不运行:队列资源耗尽,没有可用资源;NodeManager 全部不健康;标签资源不匹配。部分 task 失败,大部分 task 成功,重试几次后作业失败:优先怀疑数据倾斜、单 task 数据量过大 OOM、脏数据、shuffle 读取失败。一提交直接失败,没有任何 map/reduce task 运行:看 AM 日志,检查 jar 包、类不存在、参数错误、路径错误、权限

#大数据#mr#spark
Hadoop 数据倾斜:加盐(Salting)

识别热点 key:通过任务监控、日志、采样,找到倾斜的 key;SQL/RDD 改造,实现两阶段加盐聚合;join 倾斜需要大小表配套改造;控制盐值数量:不是越大越好,10、20、50;盐值过大生成大量小 task;优先只对热点 key 加盐,减少全量数据膨胀;测试验证结果正确性:sum/count 正确;avg 不能直接加盐;评估资源:加盐多一轮 shuffle,资源会上涨,预估资源调整参数。缺

#hadoop#大数据#分布式
Hadoop Reduce OOM 真实排查案例(Hive On MapReduce)

脏数据 → 数据倾斜 → OOM用户行为日志每日离线跑批,Hive 执行统计用户行为次数。每日跑批,某天作业突然失败,Reduce 任务 OOM,绝大多数 task 很快跑完,仅 1 个 reduce 反复重试后 OOM 失败。-99999。

#hadoop#hive#mapreduce
到底了