本教程使用所有软件版本:pycharm 25.2 ,spark 3.4.2 ,hadoop 3.3.3

一  确认虚拟环境中已安装 pyspark


source /home/hadoop/.virtualenvs/PythonProject1/bin/activate
 pip show pyspark

运行结果如图:

如果没有安装,则安装百度进行完整安装,安装完成则到下一步。

二  使用Pycharm进行连接

2.1打开pycharm进行新建项目

2.2 自行选一个python环境先将py项目建立起来,之后再做修改

2.3 打开设置并且配置解释器

2.4 选择ssh进行远程连接

2.5 输入自己的虚拟机主机名以及密码,ip地址然后一路next

如果不知道主机名可以采用如下命令进行查看

ip addr show

点击create创建

注意:若是连接不上,卡在第三步的service,首先检查主机名,密码是否输入正确,若还是不行,确保虚拟机允许ssh连接:

sudo apt install openssh-server -y
sudo systemctl start ssh
sudo systemctl enable ssh

2.6 再次点击解释器查看是否连接成功(2.3)

如下图连接成功

三 检验是否连接成功

  1. 打开 PyCharm。
  2. 点击底部工具栏 → Python Console(如果没有,可通过 View → Tool Windows → Python Console 打开)。
  3. 在 Console 中逐行输入以下代码:

from pyspark.sql import SparkSession

spark = SparkSession.builder \
    .appName("ConsoleTest") \
    .master("local[*]") \
    .getOrCreate()

print("Spark version:", spark.version)

3.1若出现版本号,则连接成功,如图:

3.2 (没错直接跳到3.3.)若是显示缺少spark模块,可能是在使用虚拟机安装spark时使用了pip命令,没有下载完整的包,建议重新下载spark完整包,并解压在指定目录下,以下是我解决方案(也可以按照书上来):

使用华为云镜像:

wget https://mirrors.huaweicloud.com/apache/spark/spark-3.4.2/spark-3.4.2-bin-hadoop3.tgz

解压到 /opt

sudo tar -xzf spark-3.4.2-bin-hadoop3.tgz -C /opt/

配置环境变量

nano ~/.bashrc

在文件末尾添加:

# Spark 完整安装
export SPARK_HOME=/opt/spark
export PATH=$SPARK_HOME/bin:$PATH
export PYTHONPATH=$SPARK_HOME/python:$SPARK_HOME/python/lib/py4j-0.10.9.7-src.zip:$PYTHONPATH

✅ 第五步:生效配置 & 验证

source ~/.bashrc
spark-submit --version

你应该看到:

Welcome to
      ____              __
     / __/__  ___ _____/ /__
    _\ \/ _ \/ _ `/ __/  '_/
   /___/ .__/\_,_/_/ /_/\_\   version 3.4.2
      /_/

Using Scala version 2.12.18, OpenJDK 64-Bit Server VM, 11.0.xx

3.3若是前面都没错,则创建一个test项目跑一下如下代码,右键点击run:

# test_spark_console.py 或直接在 PyCharm Console 中运行

from pyspark.sql import SparkSession

# 创建 SparkSession(本地模式)
spark = SparkSession.builder \
    .appName("PyCharm-Spark-Test") \
    .master("local[*]") \
    .getOrCreate()

# 打印基本信息
print("🟢 Spark 连接成功!")
print(f"✅ Spark 版本: {spark.version}")
print(f"📍 运行模式: {spark.sparkContext.master}")

# 创建一个简单 DataFrame
data = [("Alice", 25), ("Bob", 30), ("Cathy", 35)]
columns = ["Name", "Age"]
df = spark.createDataFrame(data, columns)

# 显示数据
print("\n📊 示例 DataFrame:")
df.show()

# 执行一个简单计算
avg_age = df.selectExpr("avg(Age) as AverageAge").collect()[0]["AverageAge"]
print(f"\n📈 平均年龄: {avg_age:.2f}")

# 停止 Spark(如果是在脚本中运行;Console 中可不加)
# spark.stop()

执行结果如下:

到这一步,🎉 恭喜你!现在你可以开始用 PyCharm + Spark 做数据分析、机器学习等任务了!

更多推荐