logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

深入 Hadoop HDFS:分布式存储核心,海量数据存储难题全解决!

另外,假如你的 java 版本有问题,也会报这个错误,比如我们需要 64 位的操作软件,你安装了一个 32 位的,请卸载 jdk,并重新安装和配置环境变量。Yarn :计算的资源基础,所有的MR任务需要运行在Yarn上。位置: /opt/installs/hadoop/etc/hadoop。9870:是 hdfs 的 web 端口,用于访问 hdfs 的页面的。路径:/opt/installs/h

#hadoop#分布式#hdfs
SparkCore、SparkSQL 数据读取方式及 Hive 数据来源详解

在大数据处理领域,Apache Spark 和 Apache Hive 是两款至关重要的工具。Spark 凭借其高效的内存计算能力,成为数据处理的热门选择,而 Hive 则在数据仓库构建和 SQL 分析方面发挥着重要作用。本文将详细介绍 SparkCore 和 SparkSQL 读取数据的多种方式,以及 Hive 中数据的主要来源,帮助读者更好地理解和运用这些工具进行数据处理。

文章图片
#hive#hdfs#hadoop +1
Flink窗口生命周期深度解析:eventTime、Watermarker与allowedLateness的协同机制

eventTime窗口的关闭并非由物理时间或事件时间直接决定,而是由Watermarker标记的全局时间进度与allowedLateness定义的延迟容忍期共同驱动。触发:Watermarker到达窗口结束时间;更新:Watermarker未超过窗口结束时间+allowedLateness;关闭:Watermarker突破窗口结束时间+allowedLateness。理解这一机制,不仅能避免开发中

#flink#大数据
到底了