第一部分:基础概念 —— 你需要知道的三个关键词

1. Yum —— Linux 里的“软件超市”

  • 是什么:Yum 是 Linux 系统中的一个软件包管理工具。你可以把它想象成一个“软件超市”,只要告诉它你要安装什么软件(比如 Java、Python),它就会自动从网上的“仓库”里下载并安装好,还会顺便把依赖的其他小工具一起装上。

  • 工作机制:Yum 通过读取 .repo 配置文件(相当于超市的“商品目录”)来知道去哪里下载软件。它最大的好处是自动处理依赖关系,不用你手动一个一个去找。

  • 常用命令

    • yum install 软件名 —— 安装指定软件包  
      yum remove 软件名 —— 彻底卸载指定软件包  
      yum list | grep 关键词 —— 通过关键词搜索可用软件包  
      yum clean all —— 清除所有软件包缓存(下载异常时可尝试)  
       
      
  • 小技巧:默认的 Yum 源在国外,速度慢,可以配置国内的阿里云源,下载速度会快很多。

2. Ambari —— 大数据平台的“总管家”

  • 是什么:Ambari 是一个开源工具,专门用来安装、管理和监控 Hadoop 及其生态圈的大数据软件(如 Spark、HBase、Kafka 等)。

  • 为什么需要它:手工搭建一个 Hadoop 集群非常复杂,需要配置很多文件,而且容易出错。Ambari 提供了图形化界面,你只需要在网页上点一点、填一填,它就能自动帮你在多台机器上完成部署。

  • 整体结构:Ambari 采用“服务器-代理”模式

    • Ambari Server:相当于“总指挥部”,负责管理整个集群,提供 Web 界面。

    • Ambari Agent:安装在集群的每一台机器上,负责接收 Server 的指令并执行(比如安装软件、启动服务)。

3. Hadoop2.x 集群 —— 大数据存储与计算的“团队”

  • 核心成员

    • HDFS(分布式文件系统):负责存储数据,就像一个可以跨多台机器的大硬盘。

      • NameNode:是 HDFS 的“总管”,记录文件存在哪台机器上。

      • DataNode:是真正的“仓库管理员”,实际存储数据块。

    • YARN(资源管理):负责调度任务和分配计算资源(CPU、内存)。

      • ResourceManager:统筹全局。

      • NodeManager:在每台机器上执行具体任务。

  • 其他常用服务:Spark(计算引擎)、Kafka(消息队列)、Zookeeper(协调服务)等。


第二部分:Ambari 安装流程(10 步详解)

以下步骤是基于 Ambari 官方安装向导的实际流程,也是我们后续模拟器练习的蓝本。

  1. 启动安装向导:登录 Ambari 的 Web 界面(默认地址 http://你的服务器IP:8080,账号密码为 admin/admin),点击 “Launch Install Wizard” 按钮。

  2. 命名集群:给你的集群起一个名字,例如 bigdata

  3. 选择 Stack(软件栈):Stack 相当于一个软件全家桶,里面包含了 Hadoop 生态圈的各种组件及其版本。我们选择 HDP 2.6(对应 Hadoop 2.6.x 版本)。

  4. 指定 Agent 机器:填写集群中所有机器的完整主机名(例如 bigdata1.example.com),并提供 Ambari Server 所在机器的 SSH 私钥(用于免密登录,自动安装 Agent)。

  5. 自动安装 Agent:Ambari Server 会通过 SSH 连接到刚才指定的机器,自动下载并安装 Ambari Agent,然后 Agent 会向 Server 注册。注册成功后,这些机器就纳入了管理。

  6. 选择要安装的服务:在列表里勾选你需要的组件,比如 HDFS、YARN + MapReduce2、Zookeeper、Spark、Kafka 等。Ambari 会自动检查依赖关系,如果缺少某个服务会提醒你。

  7. 分配 Master 和 Slave 节点

    • Master 节点:运行 NameNode、ResourceManager 等主服务,通常选择性能较好的机器。

    • Slave 节点:运行 DataNode、NodeManager 等从服务,负责存储和计算。

    • Client 节点:用于提交作业,不运行核心服务。

  8. 服务配置:大部分配置项都有默认值,可以直接使用。但有一些关键项(比如 HDFS 的数据存储目录)需要手动设置,注意不要设置为 /home 目录。

  9. 审阅安装列表:Ambari 会汇总你所有的选择(集群名称、Stack、服务列表、节点分配、配置参数),供你最后确认。检查无误后点击“部署”。

  10. 开始安装:Ambari 开始在线下载所有选中的软件包并安装到对应的机器上,然后自动启动服务。这个过程需要一些时间(取决于网络速度)。安装完成后,你就可以看到 Ambari 的 Dashboard(仪表盘),集群就正式运行了。


第三部分:实战模拟 —— 在脑海中走一遍部署过程

为了帮助你更好地理解上述流程,这里提供一个“模拟演练”的思维框架。你可以想象自己正在操作 Ambari 的界面,一步步完成部署。

模拟场景设定

  • 集群规模:6 台机器(均为 CentOS 7 系统)

    • ambari:安装 Ambari Server,作为管理节点

    • bigdata1:作为 NameNode 和 ResourceManager(主节点)

    • bigdata2:作为 SecondaryNameNode(备份节点)

    • bigdata3bigdata4bigdata5:作为 DataNode 和 NodeManager(工作节点)

模拟操作步骤(与上述 10 步对应)

步骤你的操作系统反馈(模拟日志)
1. 启动点击 “Launch Install Wizard”[系统] Ambari 安装向导启动。
2. 命名输入集群名称 bigdata[配置] 集群名称: bigdata
3. 选 Stack选择 HDP 2.6[配置] Stack: HDP 2.6 (Hadoop 2.6.5)
4. 指定 Agent填写 bigdata1~5 的主机名,上传 SSH 私钥[配置] Agent 主机: ambari, bigdata1-5
5. 安装 Agent点击下一步,系统自动安装[安装] 正在安装 Ambari Agent ... 注册成功。
6. 选服务勾选 HDFS, YARN, Zookeeper, Spark, Kafka[选择] 服务: HDFS, YARN, ZK, Spark2, Kafka
7. 分配节点指定 ambari 为 NameNode,bigdata3-5 为 DataNode[分配] Master: ambari (NN), bigdata1 (RM) ; Slave: bigdata3-5 (DN)
8. 配置设置 HDFS 数据目录为 /data/hdfs[配置] HDFS datadir: /data/hdfs, namenode dir: /data/name
9. 审阅检查清单,点击“部署”[审阅] 配置检查通过。准备安装 8 个服务。
10. 安装中等待进度条走完[安装] 正在下载 HDFS, YARN, Spark... 已完成 80% ...
[成功] ✅ 集群部署完成!

第四部分:集群管理 —— 部署完成后能做什么?

Ambari 不仅帮你安装集群,还提供了非常方便的管理功能,主要包括:

1. 服务管理

  • 启动/停止:你可以一键启动或停止整个服务(比如 HDFS),也可以只操作某个组件(比如只重启 DataNode)。

  • 服务检查:运行一个测试任务(比如 WordCount)来验证服务是否正常工作。

  • 添加/删除服务:后续可以随时在 Ambari 里增加新的组件(比如 Flume、Hive)。

2. 配置管理

  • 可视化修改:在 Web 界面里修改 Hadoop 的配置文件(如 core-site.xml),不需要手动编辑文件。

  • 版本回退:每次修改配置都会保存为一个历史版本,如果改错了可以一键回退到之前的版本。

  • 重启提醒:如果修改的配置需要重启服务才能生效,Ambari 会主动提示你。

3. 监控与告警

  • 仪表盘:查看整个集群的健康状态、各节点的资源使用情况(CPU、内存、磁盘)。

  • 热力图:通过颜色深浅直观显示集群的负载分布。

  • 告警:当某个节点宕机或磁盘空间不足时,Ambari 会发送告警信息。

4. 辅助工具

  • HDFS 文件浏览器:像操作网盘一样,在 Web 界面上传、下载、删除 HDFS 上的文件。

  • Quick Links:快速跳转到各个服务的原生 Web UI(比如 NameNode UI、ResourceManager UI),方便查看更详细的运行信息。


第五部分:补充知识 —— Ambari 与 CDH 的对比

在企业中,除了 Ambari + HDP 这个组合,还有一个常用的免费大数据平台是 CDH (Cloudera Distribution including Apache Hadoop)。两者都是非常优秀的工具,主要区别如下:

对比维度Ambari + HDPCDH + Cloudera Manager
维护方Hortonworks(现并入 Cloudera)Cloudera
安装方式图形化向导,类似我们模拟的流程同样是图形化向导(Cloudera Manager)
界面风格简洁直观功能丰富,企业级
安全认证支持 Kerberos支持 Kerberos,且集成度更高
社区与文档有较多中文资料官方文档非常详尽

小结:无论选择哪一种,它们的目标都是一样的——让复杂的大数据集群部署变得像“搭积木”一样简单。对于初学者来说,Ambari 的界面更加友好,非常适合入门学习。


第六部分:准备工作清单(在实际动手前需要做的)

如果你打算在自己的虚拟机或服务器上真正部署一次,请提前完成以下准备工作(这也是我们在模拟器里没有体现的“环境准备”步骤):

  1. 操作系统:所有机器安装 CentOS 7(最小化安装即可)。

  2. Java 环境:在所有节点安装 Oracle JDK 1.8,并配置好环境变量 JAVA_HOME

  3. 主机名与 hosts 文件:配置好每台机器的主机名,并在所有机器的 /etc/hosts 文件中添加完整的 IP 与主机名映射。

  4. 时间同步:安装 NTP 服务,确保所有机器的时间一致(这对 HBase 等服务很重要)。

  5. SSH 免密登录:在 Ambari Server 节点生成 SSH 密钥对,并将公钥复制到所有其他节点(包括自己)。

  6. 关闭防火墙和 SELinux:为了避免安装过程中网络通信被阻断,临时关闭防火墙和 SELinux。

  7. 调整文件打开数:使用 ulimit -n 10000 修改系统最大打开文件数限制,避免大数据任务报错。

  8. 配置 Yum 源:建议使用阿里云或国内的 Yum 源,加快软件包下载速度。

更多推荐