logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

冒泡排序:从经典到大数据,一文掌握多种解法与演进

记录每一轮最后一次发生交换的位置,该位置之后的元素已经有序,下一轮只需遍历到此位置即可。return arr。

#大数据#算法#排序算法
Hadoop Shuffle 流程详解:从 Map 到 Reduce 的数据流转(红色字体为个人经验补充,AI基础上做了修改和补充)

Shuffle 是 Hadoop MapReduce 框架中连接 Map 和 Reduce 阶段的关键过程。它负责将 Map 任务输出的中间结果进行分区、排序、合并,并传输给对应的 Reduce 任务。理解 Shuffle 流程对于优化 MapReduce 作业性能至关重要。输入:HDFS 数据块(InputSplit)处理输出:分区且排序的中间文件(每个 Map 一个)Hadoop Shuffl

#hadoop#eclipse#大数据
插入排序-大数据应用

插入排序在大数据平台中并非主角,但它是一个不可或缺的"最佳配角"。对于小规模数据或近乎有序的数据,它简单且高效。作为复杂算法(如 TimSort、归并排序)的优化子过程。在流处理实时计算中,维护固定大小的有序集合(如 Top-N)。理解并善用插入排序,能让大数据工程师在构建系统时多一种精细化的优化手段,在合适的场景下用最简单的算法获得可观的性能提升。在设计大数据处理流水线时,考虑在 Shuffle

#大数据
选择排序算法详解:核心思想、变种、时间复杂度与大数据应用(红色个人注释)

对于大数据排序,工业界普遍采用时间复杂度为O(n log n)的算法(如快速排序、归并排序、Timsort),或利用分布式计算框架(如 Apache Spark、Hadoop MapReduce)进行并行排序。核心结论:选择排序的核心价值在于其思想简单,是理解排序算法的基础。但在大数据实践中,应优先选择更高效的排序算法或利用分布式计算能力。

#算法
开源项目:SQL API Gateway V1.2.0

让数仓 SQL 像 REST API 一样被治理——有审批、有鉴权、有限流、有熔断、有审计。如果你正在做 Doris / ClickHouse 对内服务化,又不想从零搭一套数据开放平台,这个项目可以作为开箱即用的起点。代码开源、文档齐全、CI 通过,欢迎 Star 和 Issue。相关链接如需转载,请注明出处与项目链接。

#python#java#json +2
Hadoop Shuffle 流程详解:从 Map 到 Reduce 的数据流转(红色字体为个人经验补充,AI基础上做了修改和补充)

Shuffle 是 Hadoop MapReduce 框架中连接 Map 和 Reduce 阶段的关键过程。它负责将 Map 任务输出的中间结果进行分区、排序、合并,并传输给对应的 Reduce 任务。理解 Shuffle 流程对于优化 MapReduce 作业性能至关重要。输入:HDFS 数据块(InputSplit)处理输出:分区且排序的中间文件(每个 Map 一个)Hadoop Shuffl

#hadoop#eclipse#大数据
开源项目:指标管理系统 sqldm 的设计与实践

本文介绍了开源轻量级指标管理系统 sqldm(SQL-Driven Metrics),旨在解决数仓成熟后业务指标分散、口径混乱等问题。该系统通过集中管理指标元数据和SQL模板,提供审批流程控制和统一API服务,降低维护成本。采用Java 21 + Spring Boot 3.2技术栈,支持PostgreSQL数据库和容器化部署,包含角色权限体系、指标元数据模型和审批流程等核心功能。项目已开源,提供

#开源#java
到底了