
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
sparkCore读取数据的方式
PySpark创建RDD的两种方式: parallelize - 将本地集合转为分布式RDD,语法sc.parallelize(集合, 分区数),适用于小数据测试 textFile - 读取文件创建RDD,语法sc.textFile(路径, 分区数),支持本地/HDFS/S3路径,适合生产环境 两者均为惰性操作,实际计算在调用行动算子时触发。parallelize受限于Driver内存,textF

sparkSQL读取数据的方式
SparkSQL中的spark.read.format是灵活读取多种数据源的通用接口,支持CSV、JSON、Parquet、JDBC、Hive等格式。通过指定数据源类型和option参数配置,可自定义读取方式(如分隔符、Schema、连接信息等)。该接口具有通用性(兼容多种内置/第三方数据源)、灵活性(参数可配置)和扩展性(支持自定义数据源)。使用时需注意不同数据源的参数差异,需参考官方文档进行配

到底了







