logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【大数据系列】Doris模型介绍-聚合模型Aggregate

Doris聚合模型通过预聚合数据提升查询效率,将列分为Key(维度列)和Value(指标列)。相同Key的数据行会按指定聚合方式(如SUM、MAX等)合并。模型通过ETL、Compaction和查询三阶段实现数据聚合,对用户透明。建表时需注意:主键必须包含所有Key列且顺序正确,分区键必须是Key列。虽然可通过设置唯一Key保存明细数据,但生产环境不建议使用。该模型适用于数据汇总场景,能有效减少存

#大数据#数据库
Clickhouse异步/同步写入配置详解

本文介绍了ClickHouse中控制数据插入行为的两个关键参数:insert_distributed_sync(新版为distributed_foreground_insert)和async_insert。前者控制分布式表数据分片的同步/异步写入,确保强一致性但影响吞吐量;后者控制插入请求的批处理方式,提高吞吐量但牺牲实时性。文章详细对比了两者的作用机制、重要性及适用场景,并提供了全局配置、会话设

#clickhouse#数据库
【大数据系列】Doris的自动分区和数据分桶详解

Doris自动分区与数据分桶技术解析 Doris自动分区功能(2.1版本后支持)解决了手动分区和动态分区的局限性,支持基于范围(RANGE)和列表(LIST)的自动分区方式。RANGE分区适用于时间类型数据,LIST分区支持多列分区但需注意分区名长度限制。自动分区可与动态分区的生命周期管理结合使用,其中RANGE分区支持数据自动管理。 数据分桶是Doris必须的物理数据分片方式,分为Hash分桶和

#大数据#数据库
【大数据系列】Flink两阶段提交协议详解

Flink通过两阶段提交协议实现端到端精确一次语义处理,结合检查点机制确保数据不丢失、不重复。关键点包括:1)预提交阶段通过barrier标记记录状态快照;2)提交阶段在检查点完成后提交外部事务;3)支持Kafka等外部系统的分布式事务。该机制适用于金融等高精度场景,但需权衡性能与延迟。Flink 1.4.0+通过TwoPhaseCommitSinkFunction抽象类简化实现,开发者只需少量代

#flink#大数据
【问题排查】hadoop-shaded-guava依赖问题

摘要: 文章记录了一个Hadoop依赖问题的排查过程。当使用Spark读取S3文件时出现NoClassDefFoundError错误,原因是hadoop-aliyun依赖需要hadoop-shaded-guava包。通过IDEA全局搜索和报错代码定位后,发现需要在pom.xml中添加hadoop-shaded-guava依赖。最终解决方案是引入该依赖,并提供了Maven仓库搜索该包的截图和XML配

#大数据#hadoop#spark
【Flink】FlinkSQL-动态表和持续查询概念

FlinkSQL中的动态表与持续查询机制实现了对流式数据的表处理能力。动态表(Dynamic Tables)是随时间不断变化的表结构,与静态的关系型数据库表不同,它处理的是无限数据流而非有界数据集。持续查询(Continuous Query)对动态表执行不间断的查询操作,结果也是动态变化的。根据查询类型不同,结果流转换方式分为追加查询(toDataStream)和更新查询(toChangelogS

#flink#数据库#大数据
Flink集群部署以及作业提交模式详解

Flink支持多种部署模式,包括Standalone独立部署和Yarn模式。集群包含三个角色:客户端提交任务、JobManager调度管理、TaskManager执行计算。 Flink提供三种作业部署模式: 会话模式:共享集群资源,适合频繁提交短作业 单作业模式:每个作业独立集群,资源隔离性好 应用模式:以应用为单位启动集群,解耦客户端 。Yarn模式下Flink通过ResourceManager

文章图片
#flink#大数据
Clickhouse数据副本和分片

本文介绍了ClickHouse的数据副本与分区机制。集群通过分片和副本解决单点故障问题,分片实现数据水平切分,副本保证数据高可用。ReplicatedMergeTree引擎通过ZooKeeper实现副本间的分布式协同,支持多主架构和原子性写入。文章详细阐述了副本的工作原理,包括数据结构、主副本选举、任务分发等机制,并展示了ZooKeeper的配置方式。副本机制通过监听节点实现操作日志同步,确保数据

文章图片
#clickhouse#debian#运维
Flink运行时架构

Flink运行时架构,介绍了Flink集群的系统架构说明了每个组件负责的功能;核心概念讲解了并行度、算子链、任务槽;最后以Flink on yarn提交模式描述了作业从提交到运行的流程。

文章图片
#flink#架构#大数据
Clickhouse监控体系搭建

本文介绍了ClickHouse监控体系的搭建过程。随着ClickHouse在生产环境的大规模应用,面临资源竞争、故障定位困难和分布式组件复杂等运维挑战。文章详细讲解了如何配置ClickHouse内置监控端点,部署Prometheus采集监控指标,并通过Grafana实现可视化展示。具体步骤包括:修改ClickHouse配置文件开启监控端口,部署Prometheus并配置采集端点,以及安装Grafa

#clickhouse
    共 17 条
  • 1
  • 2
  • 请选择