logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Hadoop 常用端口号

默认文件系统(通常是 HDFS)的端口号,客户端通过 8020 或 9000 与 HDFS 文件系统进行交互。datanode 与 namenode、其他 datanode 的通信端口。访问 yarn resourcemanager 的 web 界面。访问 SecondaryNameNode 的 web 界面。访问 namenode 的 web 界面。访问 datanode 的 web 界面。历史

#hadoop#大数据#分布式
Hadoop 配置文件以及简单的 Hadoop 集群搭建

Hadoop集群配置与搭建摘要 本文介绍了Hadoop核心配置文件和简单集群搭建流程。主要配置文件包括:core-site.xml(文件系统设置)、hdfs-site.xml(NameNode/DataNode配置)、mapred-site.xml(MapReduce任务配置)、yarn-site.xml(资源管理配置)以及各环境变量脚本(hadoop-env.sh等)。集群搭建步骤包含:JDK安

#hadoop#eclipse#大数据
Java:HashMap中为什么用红黑树,不选择二叉排序树或平衡树

摘要:二叉排序树在极端情况下会退化为链表,失去其优势。红黑树在插入、删除操作时效率高于平衡树,而平衡树在查找时表现更优。综合考量,红黑树因其整体性能更好而成为更优选择。

#java
Java:HashMap中链表什么时候转换为红黑树

链表长度超过8,数组长度超过64。

#java
spark:如何划分 task?

Spark中的stage由taskset组成,根据分区数划分task,每个分区对应一个task。这种并行处理机制能高效执行分布式计算任务。

#spark
数仓实践:浅谈 Kimball 维度建模1

累计快照事实表:记录具有时间跨度的业务处理过程的整个信息,比如从用户下单、物流、评价、售后等整个流程的信息。事实表的度量:可累加(销售金额、销售数量)、半可累加(仅仅某些维度可加)、不可累加(订单状态)周期快照事实表:记录有规律、固定时间间隔的业务累计数据,粒度较粗,比如账户月均余额事实表。用于关联和连接相应的维度,通过这些外键,进行各个角度、维度分析。维度属性最好是文本、离散的,减少编码的使用,

Flume:Flume在电商数仓中的应用

摘要:Flume日志采集系统采用TaildirSource高效监控日志文件变化,支持断点续传和多文件监控。数据通过Kafka Channel存储,设置多个Topic分类存放日志。自定义拦截器用于ETL过滤和日志类型区分,下游消费时通过时间戳拦截器确保日志按实际时间写入HDFS路径。系统实现轻量级数据处理,但可能影响传输效率,重复数据由下游处理。

#flume#大数据
Flume:快速了解Flume

Flume是一个分布式、高可用的海量日志采集系统,核心由Agent(包含Source、Channel、Sink三组件)构成。Source负责数据采集,支持多类型数据源;Channel作为缓冲区临时存储数据;Sink将数据传输至目标系统。其特点包括可插拔架构、高可靠性(支持事务和持久化)、易扩展性,适用于离线和实时场景,是大数据领域常用的日志采集框架。

#flume#大数据
到底了