logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

# Spark 性能优化 10 个技巧

Spark 任务跑得慢?内存经常 OOM?数据倾斜让你怀疑人生?这篇文章总结了我多年大数据开发中最实用的 10 个 Spark 性能优化技巧,每个技巧都配有代码示例和参数配置,直接抄作业就能用!✅ 任务运行时间从 2 小时 → 15 分钟✅ 内存使用降低 60%✅ 数据倾斜问题彻底解决Join 操作时,某个 Key 的数据集中在一个分区技巧适用场景提升幅度合理分区所有任务2-3 倍广播变量小表 J

文章图片
#spark#性能优化#大数据
# 数据仓库分层设计指南

本文系统介绍了企业级数据仓库的分层架构设计,重点解析了ODS/DWD/DWS/ADS四层结构及其应用场景。通过电商案例展示了分层设计的必要性:解决数据冗余、口径不一致、维护成本高等问题。详细说明了每层的功能定位、命名规范和表结构设计,包括ODS层的原始数据同步、DWD层的数据清洗与标准化、DWS层的主题汇总以及ADS层的业务应用。文章提供了可落地的设计规范和避坑指南,帮助读者快速构建清晰高效的数据

文章图片
#数据仓库
# Flink 实时数仓实战

本文探讨企业级实时数仓建设方案,对比Lambda和Kappa架构的优缺点,推荐优先采用Kappa架构简化开发流程。针对电商场景中离线数据延迟、实时数据不准等痛点,提出分层设计解决方案:通过ODS原始数据层、DWD明细层、DWS聚合层和ADS应用层的四级架构,实现数据质量保障和计算逻辑统一。文章详细介绍了Flink SQL在实时数仓中的应用,包括CDC数据同步、状态后端配置等关键技术点,最终实现数据

文章图片
#flink#大数据
# Linux 大数据开发必备工具

《大数据工程师生存手册》摘要: 本书聚焦Hadoop/Spark/Flink集群运维实战,涵盖核心场景应对方案:集群告警处理(内存/磁盘/任务积压)、任务失败排查(内存溢出/参数调优)、数据异常溯源(全链路追踪)。提供30+常用命令速查(文件操作/grep/awk/sed)、系统监控技巧(进程/磁盘/网络)、HDFS/YARN故障诊断方法,并附10+实用脚本和5+生产案例。通过Linux命令、日志

文章图片
#linux#大数据#运维
# Flink 时间语义与 Watermark 详解

本文深入解析Flink实时计算中的时间语义与Watermark机制。首先通过电商场景案例展示生产环境中常见的时序问题,包括窗口计算不准、数据重复、乱序处理等。然后详细对比三种时间语义:Processing Time(处理时间)、Event Time(事件时间)和Ingestion Time(摄入时间),重点推荐使用Event Time保证数据准确性。核心部分剖析Watermark机制原理,包括其定

文章图片
#flink#php#大数据
# Spark SQL 进阶实践

本文总结了大数据开发中的核心优化技巧,包括DataFrame优化、SQL调优、广播变量、分区策略和数据倾斜处理等。通过真实生产案例展示了常见问题:Spark SQL任务慢、数据倾斜、内存溢出和小文件过多。重点介绍了Catalyst优化器的原理(谓词下推、列裁剪、常量折叠等)和四种Join优化策略(广播Join、Sort Merge Join等),并提供了两阶段聚合解决数据倾斜的实践方案。优化后查询

文章图片
#spark#sql#ajax
# Hadoop 集群搭建完整教程

本文系统介绍了Hadoop集群从零搭建到生产级部署的全流程。首先阐述了学习Hadoop集群搭建的重要性,包括面试加分、工作需求和架构理解。然后详细解析了Hadoop 3.x的核心组件架构,包括HDFS(NameNode/DataNode)和YARN(ResourceManager/NodeManager)的职责划分。重点讲解了生产环境必备的高可用(HA)架构配置方案,涉及JournalNode、Z

文章图片
#hadoop#大数据#分布式
# 大数据开发面试题库

为什么面试总被问倒?为什么项目经验说不清楚?为什么调优问题总是泛泛而谈?根本原因:没有系统准备面试题库!🔍 SQL 高频面试题(窗口函数、行转列)🔍 Spark 性能调优实战🔍 数仓建模设计题🔍 项目经验梳理方法🔍 行为面试题回答模板题目均来自真实面试,附详细答案!S(Situation):背景- 公司业务:电商平台,日订单 100 万- 数据痛点:数据分散、口径不一、查询慢T(Task

文章图片
#大数据#面试#职场和发展
# 云原生大数据平台搭建

云原生大数据平台迁移实践 本文分享了从传统IDC迁移到云原生大数据平台的经验,包含以下关键内容: 迁移动因:IDC模式存在资源利用率低(30%)、运维成本高(15人团队)、扩容周期长(2-4周)等痛点,年浪费达200万元+。 云原生优势:实现分钟级资源获取、秒级弹性、资源利用率提升至70%+,年度总成本降低32%(从850万降至580万)。 架构设计:采用分层架构(用户接入层、容器平台层、大数据服

文章图片
#云原生#大数据
# Flink 生产环境调优案例

Flink生产环境调优实战:从5000TPS到50000TPS 摘要 本文分享了一个Flink实时数据处理管道的性能调优案例。在双11大促场景下,初始系统仅能处理5000TPS,存在高延迟、频繁反压和稳定性问题。通过深入分析Flink执行内核,包括算子链优化、反压机制和状态管理,最终实现吞吐量提升10倍至50000TPS,P99延迟降至5秒以下。关键优化点包括: 合理配置算子链策略,减少序列化和网

文章图片
#flink#linq#大数据
    共 33 条
  • 1
  • 2
  • 3
  • 4
  • 请选择