logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

# Spark 性能优化 10 个技巧

Spark 任务跑得慢?内存经常 OOM?数据倾斜让你怀疑人生?这篇文章总结了我多年大数据开发中最实用的 10 个 Spark 性能优化技巧,每个技巧都配有代码示例和参数配置,直接抄作业就能用!✅ 任务运行时间从 2 小时 → 15 分钟✅ 内存使用降低 60%✅ 数据倾斜问题彻底解决Join 操作时,某个 Key 的数据集中在一个分区技巧适用场景提升幅度合理分区所有任务2-3 倍广播变量小表 J

文章图片
#spark#性能优化#大数据
# Flink 实时数仓实战

本文探讨企业级实时数仓建设方案,对比Lambda和Kappa架构的优缺点,推荐优先采用Kappa架构简化开发流程。针对电商场景中离线数据延迟、实时数据不准等痛点,提出分层设计解决方案:通过ODS原始数据层、DWD明细层、DWS聚合层和ADS应用层的四级架构,实现数据质量保障和计算逻辑统一。文章详细介绍了Flink SQL在实时数仓中的应用,包括CDC数据同步、状态后端配置等关键技术点,最终实现数据

文章图片
#flink#大数据
# Linux 大数据开发必备工具

《大数据工程师生存手册》摘要: 本书聚焦Hadoop/Spark/Flink集群运维实战,涵盖核心场景应对方案:集群告警处理(内存/磁盘/任务积压)、任务失败排查(内存溢出/参数调优)、数据异常溯源(全链路追踪)。提供30+常用命令速查(文件操作/grep/awk/sed)、系统监控技巧(进程/磁盘/网络)、HDFS/YARN故障诊断方法,并附10+实用脚本和5+生产案例。通过Linux命令、日志

文章图片
#linux#大数据#运维
# Hive 性能优化实战

摘要: 本文针对大数据开发中的性能优化问题,提出了一套核心解决方案,涵盖执行计划分析、SQL优化、Join优化、聚合优化等关键技术。通过真实生产案例,展示了电商平台查询从2.5小时降至8分钟的优化过程(提升18.75倍)。重点解析了执行计划解读、Map Join与Bucket Join的应用、两阶段聚合解决数据倾斜等技巧,并提供了参数调优和小文件合并的实践方法。优化后显著降低了资源消耗(Map任务

文章图片
#hive#性能优化#hadoop
# Spark SQL 进阶实践

本文总结了大数据开发中的核心优化技巧,包括DataFrame优化、SQL调优、广播变量、分区策略和数据倾斜处理等。通过真实生产案例展示了常见问题:Spark SQL任务慢、数据倾斜、内存溢出和小文件过多。重点介绍了Catalyst优化器的原理(谓词下推、列裁剪、常量折叠等)和四种Join优化策略(广播Join、Sort Merge Join等),并提供了两阶段聚合解决数据倾斜的实践方案。优化后查询

文章图片
#spark#sql#ajax
# Spark 内核级调优源码分析

摘要:本文深入探讨了Spark内核级调优的必要性和实施方法。常规调优手段(如增加内存、并行度)在达到性能瓶颈后效果有限,而内核级调优可带来200-1000%的性能提升。文章解析了Spark执行流程中的关键组件,包括Task调度机制(本地性级别优化)、Shuffle实现原理(三种模式对比)和统一内存管理架构(动态内存分配)。通过源码分析揭示了调优要点,如调整本地性等待时间、优化Shuffle模式选择

文章图片
#spark#ajax#大数据
# StarRocks/Doris 深度实践

StarRocks/Doris 深度实践:极速OLAP引擎对比与实战 本文深入对比了StarRocks和Doris两款OLAP引擎的核心特性与适用场景。作为同源分化的两个项目,StarRocks在查询性能(比Doris快3-10倍)、Join优化和社区活跃度方面表现更优,特别适合新项目采用。文章详细解析了其MPP架构和向量化引擎原理,展示三种数据模型(聚合、主键、明细)的应用场景,并提供分区分桶等

文章图片
# 维度建模实战:从 0 设计电商数仓

摘要:本文系统讲解大数据开发核心技能,重点解析星型模型与雪花模型的设计差异、事实表与维度表设计方法,以及拉链表实现原理。通过电商数仓案例,展示如何从0到1搭建可落地的数据仓库模型。文章首先揭示企业常见的数据混乱问题(表关系复杂、查询性能差、指标口径不一致),然后提出维度建模解决方案(事实表+维度表),对比分析星型模型(查询性能优)和雪花模型(存储空间优)的适用场景,并详细拆解事务事实表、周期快照表

文章图片
#大数据
# Kafka 消息队列实战指南

本文摘要: Kafka作为企业级消息队列,可有效解决电商等场景中的消息丢失、积压、重复和顺序错乱问题。通过ACK机制、副本配置、幂等写入和合理分区等技巧,将消息可靠性提升至99.99%,延迟降至3秒。其核心架构包含Topic、Partition、Broker等组件,支持高并发与容错。生产者配置需关注ACK级别、重试策略和批处理优化,消费者通过分组机制实现并行处理。典型应用包括数据同步、活动通知和日

文章图片
#kafka#linq#分布式
# Linux 大数据开发必备工具

《大数据工程师生存手册》摘要: 本书聚焦Hadoop/Spark/Flink集群运维实战,涵盖核心场景应对方案:集群告警处理(内存/磁盘/任务积压)、任务失败排查(内存溢出/参数调优)、数据异常溯源(全链路追踪)。提供30+常用命令速查(文件操作/grep/awk/sed)、系统监控技巧(进程/磁盘/网络)、HDFS/YARN故障诊断方法,并附10+实用脚本和5+生产案例。通过Linux命令、日志

文章图片
#linux#大数据#运维
    共 21 条
  • 1
  • 2
  • 3
  • 请选择