一、集群基础配置整体概述

大数据集群部署分为:虚拟机部署 → 集群基础配置 → 组件部署 → 自动部署 → 调优与安全集群基础配置是所有大数据组件(Hadoop、Spark、HBase、ZooKeeper)的前置必备步骤。

本次学习目标

  • 集群基础配置包含哪些内容
  • 虚拟机三种上网模式
  • 网络配置文件路径
  • 为什么关闭防火墙 & 如何关闭
  • SSH 协议是什么
  • SSH 免密登录完整流程

二、虚拟机连网模式(3 种)

1. 三种网络模式

  1. 桥接模式虚拟机与物理机在同一网段,直接连接物理网络,可上外网。适合:生产环境、需要外部访问虚拟机。

  2. NAT 模式虚拟机与物理机不同网段,共享主机 IP 上网,通过 NAT 地址转换。适合:学习搭建集群(最常用)。

  3. 仅主机模式虚拟机仅与主机互通,不能上外网,高度隔离。适合:内网安全测试。

2. 检查网络状态命令

bash

运行

# 测试网络连通
ping www.baidu.com

# 自动获取IP
dhclient

# 查看网卡与IP
ip addr
ifconfig
ifconfig -a

3. NAT 模式静态 IP 配置(集群必须固定 IP)

  1. VMware → 编辑 → 虚拟网络编辑器
  2. 选择 VMnet8(NAT)
  3. 子网 IP:192.168.2.0
  4. NAT 网关:192.168.2.1
  5. DHCP 范围:192.168.2.128 ~ 192.168.2.254

三、主机网络配置

1. 集群 IP 规划(3 节点示例)

plaintext

bigdata01  192.168.2.128
bigdata02  192.168.2.129
bigdata03  192.168.2.130
网关:192.168.2.1

2. 网卡配置文件

bash

运行

# 网卡配置目录
/etc/sysconfig/network-scripts/ifcfg-ens33

3. 静态 IP 配置内容

bash

运行

TYPE=Ethernet
BOOTPROTO=static
ONBOOT=yes
IPADDR=192.168.2.128
NETMASK=255.255.255.0
GATEWAY=192.168.2.1
DNS1=119.29.29.29

4. 重启网络

bash

运行

systemctl restart network

5. 主机名映射(hosts)

Linux 配置

bash

运行

vi /etc/hosts

添加:

plaintext

192.168.2.128 bigdata01
192.168.2.129 bigdata02
192.168.2.130 bigdata03

Windows 配置

路径:

plaintext

C:\Windows\System32\drivers\etc\hosts

添加相同映射。


四、防火墙与时钟同步

1. 为什么关闭防火墙

集群节点之间需要大量端口通信,防火墙会拦截通信,导致组件启动失败、心跳丢失。学习 / 测试环境直接关闭。

2. 关闭防火墙命令

bash

运行

# 关闭
systemctl stop firewalld.service

# 禁止开机自启
systemctl disable firewalld.service

# 查看状态
firewall-cmd --state

3. 时钟同步(NTP)

集群所有节点时间必须一致,否则 Hadoop 等组件异常。

bash

运行

# 查看是否安装
rpm -qa | grep ntp

# 安装
yum install ntp ntpdate -y

# 启动并开机自启
systemctl start ntpd
systemctl enable ntpd

# 手动同步时间
ntpdate -u 时间服务器IP

五、安装 JDK(大数据必备环境)

1. 安装(rpm 方式)

bash

运行

rpm -ivh jdk-xxx.rpm

默认安装路径:/usr/java

2. 配置环境变量

bash

运行

vi /etc/profile

末尾添加:

bash

运行

export JAVA_HOME=/usr/java/jdk1.8.0_181-amd64
export CLASSPATH=.:$JAVA_HOME/lib
export PATH=$JAVA_HOME/bin:$PATH

3. 生效并验证

bash

运行

source /etc/profile
java -version

六、集群网络配置(虚拟机克隆)

1. 虚拟机克隆

选择完整克隆,克隆后必须修改以下内容保证唯一性:

  • IP 地址
  • UUID
  • MAC 地址
  • 主机名
  • hosts 映射

2. 克隆后唯一性配置

bash

运行

# 修改网卡配置
vi /etc/sysconfig/network-scripts/ifcfg-ens33

# 删除UUID、HWADDR

# 删除网卡规则文件
rm -rf /etc/udev/rules.d/70-persistent-net.rules

# 修改主机名
vi /etc/sysconfig/network

七、SSH 免密登录 & 用户管理

1. SSH 协议

SSH 是加密网络传输协议,用于安全远程登录,大数据集群依赖 SSH 实现节点通信。

2. 免密原理

  • 生成 公钥 + 私钥
  • 公钥分发给所有节点
  • 连接时公私钥匹配,直接登录不用密码

3. 免密登录命令(所有节点执行)

bash

运行

# 生成密钥(一路回车)
ssh-keygen -t rsa

# 分发公钥
ssh-copy-id bigdata01
ssh-copy-id bigdata02
ssh-copy-id bigdata03

# 测试免密
ssh bigdata02

密钥目录:/root/.ssh/

4. 集群用户管理(生产规范)

生产环境禁止直接用 root,必须使用普通用户。

bash

运行

# 创建用户组
groupadd bd

# 创建用户
useradd -g bd py

# 设置密码
passwd py

# 赋予sudo权限
chmod 777 /etc/sudoers
vi /etc/sudoers
# 添加:py  ALL=(ALL)   ALL
chmod 440 /etc/sudoers

# 切换用户
su py

# 删除用户
userdel py

八、总结(必背)

  1. 虚拟机上网模式:NAT(学习首选)、桥接、仅主机
  2. 网卡配置路径:/etc/sysconfig/network-scripts/
  3. 集群必须:固定 IP、关闭防火墙、时间同步、hosts 映射
  4. 大数据基础环境:JDK + SSH 免密 + 普通用户权限
  5. 克隆虚拟机必须修改:IP、UUID、MAC、主机名

更多推荐