大数据分布式集群基础配置
·
一、集群基础配置整体概述
大数据集群部署分为:虚拟机部署 → 集群基础配置 → 组件部署 → 自动部署 → 调优与安全。集群基础配置是所有大数据组件(Hadoop、Spark、HBase、ZooKeeper)的前置必备步骤。
本次学习目标
- 集群基础配置包含哪些内容
- 虚拟机三种上网模式
- 网络配置文件路径
- 为什么关闭防火墙 & 如何关闭
- SSH 协议是什么
- SSH 免密登录完整流程
二、虚拟机连网模式(3 种)
1. 三种网络模式
-
桥接模式虚拟机与物理机在同一网段,直接连接物理网络,可上外网。适合:生产环境、需要外部访问虚拟机。
-
NAT 模式虚拟机与物理机不同网段,共享主机 IP 上网,通过 NAT 地址转换。适合:学习搭建集群(最常用)。
-
仅主机模式虚拟机仅与主机互通,不能上外网,高度隔离。适合:内网安全测试。
2. 检查网络状态命令
bash
运行
# 测试网络连通
ping www.baidu.com
# 自动获取IP
dhclient
# 查看网卡与IP
ip addr
ifconfig
ifconfig -a
3. NAT 模式静态 IP 配置(集群必须固定 IP)
- VMware → 编辑 → 虚拟网络编辑器
- 选择 VMnet8(NAT)
- 子网 IP:
192.168.2.0 - NAT 网关:
192.168.2.1 - DHCP 范围:
192.168.2.128 ~ 192.168.2.254
三、主机网络配置
1. 集群 IP 规划(3 节点示例)
plaintext
bigdata01 192.168.2.128
bigdata02 192.168.2.129
bigdata03 192.168.2.130
网关:192.168.2.1
2. 网卡配置文件
bash
运行
# 网卡配置目录
/etc/sysconfig/network-scripts/ifcfg-ens33
3. 静态 IP 配置内容
bash
运行
TYPE=Ethernet
BOOTPROTO=static
ONBOOT=yes
IPADDR=192.168.2.128
NETMASK=255.255.255.0
GATEWAY=192.168.2.1
DNS1=119.29.29.29
4. 重启网络
bash
运行
systemctl restart network
5. 主机名映射(hosts)
Linux 配置
bash
运行
vi /etc/hosts
添加:
plaintext
192.168.2.128 bigdata01
192.168.2.129 bigdata02
192.168.2.130 bigdata03
Windows 配置
路径:
plaintext
C:\Windows\System32\drivers\etc\hosts
添加相同映射。
四、防火墙与时钟同步
1. 为什么关闭防火墙
集群节点之间需要大量端口通信,防火墙会拦截通信,导致组件启动失败、心跳丢失。学习 / 测试环境直接关闭。
2. 关闭防火墙命令
bash
运行
# 关闭
systemctl stop firewalld.service
# 禁止开机自启
systemctl disable firewalld.service
# 查看状态
firewall-cmd --state
3. 时钟同步(NTP)
集群所有节点时间必须一致,否则 Hadoop 等组件异常。
bash
运行
# 查看是否安装
rpm -qa | grep ntp
# 安装
yum install ntp ntpdate -y
# 启动并开机自启
systemctl start ntpd
systemctl enable ntpd
# 手动同步时间
ntpdate -u 时间服务器IP
五、安装 JDK(大数据必备环境)
1. 安装(rpm 方式)
bash
运行
rpm -ivh jdk-xxx.rpm
默认安装路径:/usr/java
2. 配置环境变量
bash
运行
vi /etc/profile
末尾添加:
bash
运行
export JAVA_HOME=/usr/java/jdk1.8.0_181-amd64
export CLASSPATH=.:$JAVA_HOME/lib
export PATH=$JAVA_HOME/bin:$PATH
3. 生效并验证
bash
运行
source /etc/profile
java -version
六、集群网络配置(虚拟机克隆)
1. 虚拟机克隆
选择完整克隆,克隆后必须修改以下内容保证唯一性:
- IP 地址
- UUID
- MAC 地址
- 主机名
- hosts 映射
2. 克隆后唯一性配置
bash
运行
# 修改网卡配置
vi /etc/sysconfig/network-scripts/ifcfg-ens33
# 删除UUID、HWADDR
# 删除网卡规则文件
rm -rf /etc/udev/rules.d/70-persistent-net.rules
# 修改主机名
vi /etc/sysconfig/network
七、SSH 免密登录 & 用户管理
1. SSH 协议
SSH 是加密网络传输协议,用于安全远程登录,大数据集群依赖 SSH 实现节点通信。
2. 免密原理
- 生成 公钥 + 私钥
- 把公钥分发给所有节点
- 连接时公私钥匹配,直接登录不用密码
3. 免密登录命令(所有节点执行)
bash
运行
# 生成密钥(一路回车)
ssh-keygen -t rsa
# 分发公钥
ssh-copy-id bigdata01
ssh-copy-id bigdata02
ssh-copy-id bigdata03
# 测试免密
ssh bigdata02
密钥目录:/root/.ssh/
4. 集群用户管理(生产规范)
生产环境禁止直接用 root,必须使用普通用户。
bash
运行
# 创建用户组
groupadd bd
# 创建用户
useradd -g bd py
# 设置密码
passwd py
# 赋予sudo权限
chmod 777 /etc/sudoers
vi /etc/sudoers
# 添加:py ALL=(ALL) ALL
chmod 440 /etc/sudoers
# 切换用户
su py
# 删除用户
userdel py
八、总结(必背)
- 虚拟机上网模式:NAT(学习首选)、桥接、仅主机
- 网卡配置路径:
/etc/sysconfig/network-scripts/ - 集群必须:固定 IP、关闭防火墙、时间同步、hosts 映射
- 大数据基础环境:JDK + SSH 免密 + 普通用户权限
- 克隆虚拟机必须修改:IP、UUID、MAC、主机名
更多推荐
所有评论(0)