
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
Hadoop中的Shuffle过程:MapReduce的数据枢纽
Shuffle过程作为MapReduce的"数据枢纽",其设计体现了分布式计算的精髓:通过数据本地化、并行处理和分级聚合等策略,在大规模数据环境下实现了高效可靠的数据交换。深入理解Shuffle机制,有助于优化MapReduce作业性能。掌握Shuffle的调优技巧,往往能让作业执行效率获得数倍提升。
Spark Core、Spark SQL 数据读取方式及 Hive 数据来源解析
Hive 的数据来源本质是 “外部数据写入 HDFS(或兼容存储)+ Hive 元数据关联”,核心支持本地文件上传、关系型数据库批量导入两种场景,适配离线数仓的基础数据接入需求。Spark Core:分为并行化集合(本地测试)和外部存储读取(生产核心),基于 RDD 支持自定义解析,适配非结构化 / 半结构化数据。Spark SQL:专注结构化数据,新增 TSV 格式读取适配,内置自动解析和 SQ
到底了







