logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

SparkSQL 之 Hive On Spark 原理分析

RSC:Hive 内嵌 Driver,通过 SparkClient 向 YARN 提交作业。引擎选择:Tez 纯 SQL 更快,Spark 迭代/ML 更优。配置关键:spark.yarn.jars 必配 + Dynamic Allocation。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

文章图片
#hive#spark#hadoop
SparkSQL 之 Hive On Spark 原理分析

RSC:Hive 内嵌 Driver,通过 SparkClient 向 YARN 提交作业。引擎选择:Tez 纯 SQL 更快,Spark 迭代/ML 更优。配置关键:spark.yarn.jars 必配 + Dynamic Allocation。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

文章图片
#hive#spark#hadoop
SparkSQL 之序列化问题深度剖析

三层序列化:Task Closure(Kryo) + Shuffle(RDD用Kryo/Dataset用Encoder) + Dataset Internal(Encoder旁路)。性能排名Dataset Shuffle 自动走 Encoder。避坑五法:@transient lazy / 广播变量 / mapPartitions / Serializable / 局部变量捕获。作者:starzy

文章图片
#大数据#spark
SparkSQL 之 JDBC 数据转 DataSet 代码实现

三种读取模式:整表/subquery + 数值列分区 + 自定义 Predicate。推荐用分区并行读。优化要点:谓词/列裁剪下推 + numPartitions ≤ 20 + batchsize=5000~10000。避坑:控制连接数、避免分区倾斜、查询加 WHERE 限制。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程

文章图片
#大数据#spark
SparkSQL 之 JDBC 数据转 DataSet 代码实现

三种读取模式:整表/subquery + 数值列分区 + 自定义 Predicate。推荐用分区并行读。优化要点:谓词/列裁剪下推 + numPartitions ≤ 20 + batchsize=5000~10000。避坑:控制连接数、避免分区倾斜、查询加 WHERE 限制。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程

文章图片
#大数据#spark
SparkSQL 演变历史分析

演变主线Catalyst 四阶段:Analysis→Logical Optimization(70+规则)→Physical Planning(CBO+AQE)→Code Generation。关键转折:DataFrame(1.3)让 Spark 有了查询优化器;Dataset(1.6)让 API 层面类型安全;AQE(3.0)让优化从编译时跃升到运行时。作者:starzy博客GitHub专注 A

文章图片
#spark#大数据#分布式
SparkSQL 演变历史分析

演变主线Catalyst 四阶段:Analysis→Logical Optimization(70+规则)→Physical Planning(CBO+AQE)→Code Generation。关键转折:DataFrame(1.3)让 Spark 有了查询优化器;Dataset(1.6)让 API 层面类型安全;AQE(3.0)让优化从编译时跃升到运行时。作者:starzy博客GitHub专注 A

文章图片
#spark#大数据#分布式
SparkSQL 之 Parquet 数据转 DataSet 代码实现

Parquet 三大能力:Schema 自描述(零推断)、谓词下推(Row Group 级跳过)、Vectorized 批量解码(3~5x)。4 级物理布局:列式 + 自描述 + 压缩 3~10x + 零推断。生产环境首选。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

文章图片
#大数据#spark
SparkSQL 之 Parquet 数据转 DataSet 代码实现

Parquet 三大能力:Schema 自描述(零推断)、谓词下推(Row Group 级跳过)、Vectorized 批量解码(3~5x)。4 级物理布局:列式 + 自描述 + 压缩 3~10x + 零推断。生产环境首选。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

文章图片
#大数据#spark
SparkSQL 之 Parquet 数据转 DataSet 代码实现

Parquet 三大能力:Schema 自描述(零推断)、谓词下推(Row Group 级跳过)、Vectorized 批量解码(3~5x)。4 级物理布局:列式 + 自描述 + 压缩 3~10x + 零推断。生产环境首选。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

文章图片
#大数据#spark
    共 28 条
  • 1
  • 2
  • 3
  • 请选择