Hadoop新手别慌!手把手带你逛明白HDFS和YARN的Web管理后台
·
Hadoop新手别慌!手把手带你逛明白HDFS和YARN的Web管理后台
第一次登录Hadoop集群的Web管理界面时,面对密密麻麻的菜单和图表,很多新手会感到手足无措。这就像走进一个陌生的超市,如果不熟悉货架布局,找瓶酱油可能都要转上半小时。本文将带你像熟悉自家厨房一样,快速掌握HDFS和YARN两大核心组件的Web UI导航技巧。
1. 快速诊断集群健康状况
1.1 HDFS仪表盘:一眼看穿存储危机
打开HDFS的Overview页面(默认端口9870),重点关注三个关键指标:
- Storage Used :已用存储比例超过85%时,需要立即扩容或清理数据
- Blocks with corrupt replicas :出现非零值表示有数据块损坏
- Number of Dead DataNodes :显示离线节点数量,影响数据可靠性
紧急情况处理流程 :
- 检查
/logs/下的NameNode日志 - 查看
Datanode Volume Failures页面确认具体故障磁盘 - 必要时执行
hdfs dfsadmin -report获取详细报告
注意:当
Under Replicated Blocks持续增长时,可能是节点故障或网络问题导致副本无法正常复制
1.2 YARN资源监控:揪出性能瓶颈
YARN的Cluster Metrics页面(默认端口8088)需要特别关注:
| 指标 | 警戒值 | 应对措施 |
|---|---|---|
| Memory Used (%) | >80% | 检查是否有内存泄漏的应用 |
| VCores Used (%) | >90% | 优化任务调度或扩容集群 |
| Pending Applications | >5 | 检查资源分配策略或队列优先级 |
典型问题排查案例 :
# 查看占用资源最多的应用
yarn application -list | sort -k6 -nr | head
2. 数据管理实战指南
2.1 文件系统可视化操作
HDFS的 Utilities -> Browse the file system 页面支持:
- 拖拽上传 :直接拖动本地文件到浏览器窗口
- 权限管理 :右键文件可修改chmod权限
- 实时预览 :支持文本文件在线查看(不超过1MB)
常用路径速查表 :
/tmp:临时文件,定期清理/user:各用户专属目录/hbase:HBase默认数据存储位置
2.2 数据节点维护技巧
在 Datanodes 页面可以:
- 点击节点IP进入详情页
- 检查
Last Contact时间(超过5分钟需警惕) - 查看
Volume列表中的故障磁盘标识
磁盘故障处理步骤 :
- 标记坏盘:
hdfs dfsadmin -reportBadDisks - 下线节点:
hdfs dfsadmin -decommission - 更换硬件后重新上线
3. 任务调度深度解析
3.1 YARN应用追踪术
通过 Applications 页面可以:
- 按状态过滤(RUNNING/FAILED/KILLED)
- 查看每个任务的资源消耗曲线
- 下载完整应用日志(无需登录服务器)
任务卡死排查清单 :
- 检查
Application Attempts重试次数 - 查看
Diagnostics错误信息 - 分析
Resource Usage是否超出申请量
# 示例:通过REST API获取失败应用详情
import requests
resp = requests.get('http://yarn-master:8088/ws/v1/cluster/apps/{app_id}')
print(resp.json()['app']['diagnosticsInfo'])
3.2 调度器配置优化
在 Scheduler 页面可以观察到:
- 各队列资源使用热力图
- 当前调度策略(Fair/Capacity)
- 待处理请求的等待时间
调优参数建议 :
yarn.scheduler.minimum-allocation-mb:避免小任务碎片化yarn.nodemanager.resource.memory-mb:匹配物理内存80%yarn.scheduler.maximum-allocation-vcores:控制单任务最大核数
4. 高级调试技巧
4.1 日志分析三板斧
- 集中查看 :通过
Logs聚合页面检索所有节点日志 - 时间定位 :使用
Time Range过滤关键时段 - 模式匹配 :输入
Exception或ERROR快速定位问题
常见错误模式 :
No space left on device:存储空间不足Connection refused:服务未启动或网络故障DISK_FAILURE:硬盘物理损坏
4.2 JMX指标监控
每个页面底部的 JMX 链接提供原始监控数据,可用于:
- 对接Prometheus等监控系统
- 自定义告警规则
- 历史性能分析
关键JMX指标 :
Hadoop:service=NameNode,name=NameNodeInfo:FS状态Hadoop:service=ResourceManager,name=QueueMetrics:队列负载java.lang:type=Memory:JVM内存使用
掌握这些技巧后,你会发现自己不再是被动查看数据,而是能主动发现和解决问题。记得把常用页面加入书签,定期检查关键指标,集群管理就会变得轻松高效。
更多推荐
所有评论(0)