
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
RSC:Hive 内嵌 Driver,通过 SparkClient 向 YARN 提交作业。引擎选择:Tez 纯 SQL 更快,Spark 迭代/ML 更优。配置关键:spark.yarn.jars 必配 + Dynamic Allocation。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

RSC:Hive 内嵌 Driver,通过 SparkClient 向 YARN 提交作业。引擎选择:Tez 纯 SQL 更快,Spark 迭代/ML 更优。配置关键:spark.yarn.jars 必配 + Dynamic Allocation。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

三层序列化:Task Closure(Kryo) + Shuffle(RDD用Kryo/Dataset用Encoder) + Dataset Internal(Encoder旁路)。性能排名Dataset Shuffle 自动走 Encoder。避坑五法:@transient lazy / 广播变量 / mapPartitions / Serializable / 局部变量捕获。作者:starzy

三种读取模式:整表/subquery + 数值列分区 + 自定义 Predicate。推荐用分区并行读。优化要点:谓词/列裁剪下推 + numPartitions ≤ 20 + batchsize=5000~10000。避坑:控制连接数、避免分区倾斜、查询加 WHERE 限制。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程

三种读取模式:整表/subquery + 数值列分区 + 自定义 Predicate。推荐用分区并行读。优化要点:谓词/列裁剪下推 + numPartitions ≤ 20 + batchsize=5000~10000。避坑:控制连接数、避免分区倾斜、查询加 WHERE 限制。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程

演变主线Catalyst 四阶段:Analysis→Logical Optimization(70+规则)→Physical Planning(CBO+AQE)→Code Generation。关键转折:DataFrame(1.3)让 Spark 有了查询优化器;Dataset(1.6)让 API 层面类型安全;AQE(3.0)让优化从编译时跃升到运行时。作者:starzy博客GitHub专注 A

演变主线Catalyst 四阶段:Analysis→Logical Optimization(70+规则)→Physical Planning(CBO+AQE)→Code Generation。关键转折:DataFrame(1.3)让 Spark 有了查询优化器;Dataset(1.6)让 API 层面类型安全;AQE(3.0)让优化从编译时跃升到运行时。作者:starzy博客GitHub专注 A

Parquet 三大能力:Schema 自描述(零推断)、谓词下推(Row Group 级跳过)、Vectorized 批量解码(3~5x)。4 级物理布局:列式 + 自描述 + 压缩 3~10x + 零推断。生产环境首选。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

Parquet 三大能力:Schema 自描述(零推断)、谓词下推(Row Group 级跳过)、Vectorized 批量解码(3~5x)。4 级物理布局:列式 + 自描述 + 压缩 3~10x + 零推断。生产环境首选。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。

Parquet 三大能力:Schema 自描述(零推断)、谓词下推(Row Group 级跳过)、Vectorized 批量解码(3~5x)。4 级物理布局:列式 + 自描述 + 压缩 3~10x + 零推断。生产环境首选。作者:starzy博客GitHub专注 AI Agent · LangGraph · RAG · 大数据架构 · 数据工程实践。








