Hadoop新手别慌!手把手带你逛明白HDFS和YARN的Web管理后台
Hadoop新手别慌!手把手带你逛明白HDFS和YARN的Web管理后台
第一次登录Hadoop集群的管理后台,面对满屏的数字和图表,是不是有点手足无措?别担心,这篇文章将带你像逛商场一样轻松探索HDFS和YARN的Web UI。我们会从最基础的访问入口开始,一步步解读那些看似复杂却极其有用的监控指标,让你快速掌握集群健康检查的核心技能。
1. 准备工作:找到Hadoop管理后台的入口
在开始探索之前,我们需要知道如何访问这些管理界面。Hadoop的Web UI默认通过特定端口提供服务:
- HDFS NameNode UI :默认端口50070(较新版本为9870)
- YARN ResourceManager UI :默认端口8088
假设你的NameNode服务器IP是192.168.1.100,那么在浏览器中输入:
http://192.168.1.100:50070
就能访问HDFS的管理界面。同理,YARN的界面可以通过:
http://192.168.1.100:8088
访问。
提示:如果无法访问,请检查防火墙设置和Hadoop服务是否正常运行。可以使用
netstat -tuln | grep <端口号>命令验证服务是否在监听。
2. HDFS管理界面深度导览
2.1 Overview页面:集群健康仪表盘
这是你进入HDFS UI后看到的第一个页面,相当于集群的"健康体检报告"。重点关注以下几个指标:
| 指标名称 | 正常状态 | 异常可能原因 |
|---|---|---|
| Configured Capacity | 稳定增长 | 突然下降可能表示节点离线 |
| DFS Used% | <70% | 接近100%需紧急扩容 |
| Under replicated blocks | 0 | 大于0需检查节点网络 |
| Blocks with corrupt replicas | 0 | 大于0表示数据损坏 |
小技巧 :点击"Live Nodes"后面的数字,可以直接跳转到节点详情页面。
2.2 Datanodes页面:存储节点的体检中心
这个页面列出了所有数据节点的状态,重点关注以下列:
- Last Contact :应该显示"几秒前",如果数值很大(如小时级),说明节点可能失联
- Admin State :正常应为"In Service","Decommissioned"表示节点已下线
- Used% :各节点使用率应该均衡,差异过大会影响性能
点击任意节点IP,进入单个节点详情页,这里有两个实用功能:
- Block Pool Used :查看该节点上各块池的空间使用情况
- Logs :通过
http://<节点IP>:9864/logs/查看该节点的实时日志
2.3 实用功能:文件浏览与操作
在顶部导航栏找到"Utilities" → "Browse the file system",这里你可以:
- 查看HDFS目录结构
- 预览文件内容(文本文件)
- 上传/下载文件
- 创建新目录
注意:直接通过UI操作文件系统在生产环境要谨慎,建议先在测试环境练习。
3. YARN管理界面实战指南
3.1 Applications页面:任务监控中心
这是YARN UI中最重要的页面,展示了所有应用程序的状态。新手应该掌握:
- Filter功能 :可以按用户、队列、状态等筛选应用
- Application Type :区分MAPREDUCE、SPARK等不同计算框架的任务
- Progress :完成百分比,长时间卡住可能有问题
- Tracking UI :点击可跳转到应用自己的监控页面(如Spark History Server)
常见问题排查 :
- 应用一直处于ACCEPTED状态:可能是资源不足或调度队列堵塞
- 应用FAILED:点击应用ID查看详细日志
3.2 Cluster Metrics:资源大盘
页面顶部的集群指标概览非常有用:
Cluster Metrics:
Memory Total: 100GB
Memory Used: 30GB (30%)
VCores Total: 40
VCores Used: 12 (30%)
健康集群的特征:
- Memory/VCores Used% :长期<80%
- Containers Running :根据任务数量波动正常
- Nodes :活跃节点数稳定
3.3 Nodes页面:计算节点监控
这个页面类似于HDFS的Datanodes,但关注的是计算资源:
- Node State :应该是RUNNING
- Last Health Update :应该是最新时间
- Used Memory/VCores :观察是否有个别节点负载过高
点击节点地址进入详情页,可以查看:
- 该节点上运行的所有容器
- 资源使用历史图表
- 节点配置信息
4. 日常运维检查清单
为了帮助你快速上手日常监控,这里提供一个简单的检查清单:
每日必查项目 :
- [ ] HDFS Overview页面的Used%和Under replicated blocks
- [ ] YARN Applications页面是否有长时间运行或失败的任务
- [ ] 对比Live Nodes数量与预期是否一致
- [ ] 检查各节点的Last Contact时间是否新鲜
每周深度检查 :
- [ ] 审查各节点的存储使用均衡性
- [ ] 检查是否有Decommissioned节点需要处理
- [ ] 清理已完成的应用历史记录(特别是FAILED状态的)
5. 高级技巧:从UI发现问题的方法
当你对基础操作熟悉后,可以尝试通过这些UI发现更深层次的问题:
HDFS空间异常增长排查 :
- 在Overview页面记录DFS Used%变化
- 使用"Browse the file system"按修改时间排序
- 检查最近修改的大文件是否合理
YARN应用性能分析 :
- 在Applications页面找到运行缓慢的应用
- 点击进入详情页查看各阶段的耗时
- 检查Resource Requests是否合理
- 查看Logs寻找可能的错误或警告
节点不稳定的诊断 :
- 对比问题节点的Last Contact时间
- 检查该节点的硬件指标(通过/9999端口)
- 查看节点日志中的异常信息
更多推荐
所有评论(0)