logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Hive 数据质量检测

可以检测Hive的元数据,比如Hive表元数据存在Mysql中,可以在Mysql中查询mysql> desc TBLS;+--------------------+--------------+------+-----+---------+-------+| Field| Type| Null | Key | Default | Extra |+--------------------+--

#hive
Spark有几种分区器

本文介绍了Spark中的三种分区器:HashPartitioner(默认分区器,通过哈希函数分配key)、RangePartitioner(按key范围排序分区)和CustomPartitioner(自定义分区规则)。它们分别适用于不同场景:HashPartitioner用于通用聚合操作,RangePartitioner适合排序和范围查询,CustomPartitioner可解决数据倾斜和特定业务

#spark#大数据#分布式
Flink sql有几种join方式

Flink SQL Join 可以从 SQL 语义和流计算实现两个维度分类。SQL 语义包括 Inner/Left/Right/Full/Cross Join,而流计算实现则分为 Regular Join、Interval Join、Window Join、Temporal Join 和 Lookup Join,后者更关键,决定了状态大小、数据延迟等核心特性。 Regular Join 适用于无界

#flink#sql#数据库
Flink sql固定时间窗口join

本文介绍了Flink中的Window Join操作,重点分析了其核心概念和实现方式。Window Join通过将两条流数据划分到相同窗口内进行关联,确保只有同一时间段内且满足关联条件的数据才会被匹配。 文章详细说明了Window Join的基本思想、语法结构以及典型应用场景(如订单支付匹配)。特别强调了窗口时间字段(window_start和window_end)作为必要关联条件的重要性,并解释了

#flink#sql#linq
Spark 有哪些join方式

Spark Join 分类与优化摘要 Spark Join分为语义类型和执行策略两个维度: SQL语义类型:包括Inner、Left/Right/Full Outer、Semi/Anti及Cross Join,适用于不同业务场景(如数据匹配、存在性检查、对账等) 物理执行策略:核心算法有: Broadcast Hash Join:广播小表,避免大表Shuffle,适用于维表关联 Sort Merg

#spark#服务器#大数据
flink Interval Join 入门

SELECT ...l.event_time - INTERVAL '前置时间'AND l.event_time + INTERVAL '后置时间';它解决的是:两条流中,业务键相同且事件时间差在指定范围内的数据关联问题。表示:同一个订单,在下单后 30 分钟内发生的支付,可以和订单匹配。

#flink#java#linux
数据湖有必要吗

数据湖的核心不是“把文件放到对象存储里”,而是建立一套能够长期保存、加工、查询和治理多种数据的系统。数据湖低成本存储多格式数据批流计算表格式Catalog数据治理Parquet / ORC:保存数据文件Hudi / Iceberg / Delta Lake:管理数据湖表Spark / Flink / Trino:处理和查询数据S3 / OSS / HDFS:提供底层存储最关键的一点是:没有数据治理

#大数据
claude code跳过官方登录

本文介绍了在Linux服务器上安装Claude Code并配置国内代理的完整方案。通过npm安装Claude Code CLI后,创建两个关键配置文件:~/.claude.json用于跳过官方登录引导,~/.claude/settings.json配置代理API端点、密钥和DeepSeek模型。方案优势包括:无需官方API Key、支持国内模型、一次配置永久生效。验证成功的标志是能正常执行clau

spark catalog与hive metastore的区别

但它们在实现方式和使用场景上有所不同。Spark Catalog是Spark内置的一个元数据管理组件,用于管理Spark数据源、表、视图等元数据信息。Spark Catalog支持多种数据源,包括HDFS、Hive、JDBC等,可以将这些数据源中的数据映射为Spark中的表,从而方便地进行数据处理和分析。。。Hive Metastore支持将Hive表关联到多种数据源,包括HDFS、HBase、A

文章图片
#hive#spark#hadoop
spark.network.timeout参数入门

默认120s所有网络交互的默认超时时间。 如果未配置,则将使用此配置代替spark.storage.blockManagerSlaveTimeoutMs,spark.shuffle.io.connectionTimeout,spark.rpc.askTimeout或spark.rpc.lookupTimeout。用途若如出现各种timeout,executor lost ,task lostspa

#spark
    共 58 条
  • 1
  • 2
  • 3
  • 6
  • 请选择