logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

sparkCore读取数据的方式

PySpark创建RDD的两种方式: parallelize - 将本地集合转为分布式RDD,语法sc.parallelize(集合, 分区数),适用于小数据测试 textFile - 读取文件创建RDD,语法sc.textFile(路径, 分区数),支持本地/HDFS/S3路径,适合生产环境 两者均为惰性操作,实际计算在调用行动算子时触发。parallelize受限于Driver内存,textF

文章图片
#大数据#spark
sparkSQL读取数据的方式

SparkSQL中的spark.read.format是灵活读取多种数据源的通用接口,支持CSV、JSON、Parquet、JDBC、Hive等格式。通过指定数据源类型和option参数配置,可自定义读取方式(如分隔符、Schema、连接信息等)。该接口具有通用性(兼容多种内置/第三方数据源)、灵活性(参数可配置)和扩展性(支持自定义数据源)。使用时需注意不同数据源的参数差异,需参考官方文档进行配

文章图片
#database#big data#spark
到底了