logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【Elasticsearch】ES内存分配规划、熔断器

它实际上是node level的一个统计值,统计的是这个结点上,各类查询聚合操作,需要申请的Bigarray的空间大小总和。,针对text字段,没有docValues属性(相当于列存储),当对text类型字段进行sort,agg时,需要将对应的字段内容全部加载到内存,这部分数据就放在fieldDataCache。通过上表可知,segment memory是非常重要,而且是不可通过参数干预的内存空间

文章图片
#elasticsearch#jvm#java
【clickhouse】未解决 ClickHouse exception, code: 1002 DB::Exception: Directory already exists

进入ClickHouse的数据存储目录/var/lib/clickhouse/data/quant/trade_record/,查看是否有名为tmp_merge_2012_210_215_1的目录。如果仍然无法解决问题,建议备份数据后,卸载并重新安装ClickHouse,然后将备份数据恢复到新安装的ClickHouse中。首先,确认是否有其他进程正在使用ClickHouse,如果有,请等待其他操作

文章图片
#数据库#database
【maven】Maven删除重复的依赖关系、maven-enforcer-plugin插件

本文中,我们学习了如何使用mvn dependency:tree和mvn dependency:analyze-duplicate命令检测Maven中的重复依赖,还学习了如何使用Maven Enforcer插件,通过应用内置规则使包含重复依赖的构建失败。

文章图片
#maven#java#spring
【Elastic】ElasticView 一款用来监控elasticsearch web可视化工具

1.概述ElasticView 是一款用来监控elasticsearch状态和操作elasticsearch索引的web可视化工具。它由golang开发而成,具有部署方便,占用内存小等优点主要有以下新特性:es连接树管理(更方便的切换测试/生产环境)支持es版本 6.x, 7.x,8.x权限管理支持sql转换成dsl语法更方便的重建索引任务管理备份管理可将查询内容下载为excel文件可进行索引创建

#elasticsearch#搜索引擎#大数据
【Atlas】Apache Atlas 是否属于 Hadoop 生态?它与 Hadoop 的关系是怎样的?

Apache Atlas与Hadoop生态关系解析:从深度集成到跨平台演进 摘要(148字) Apache Atlas最初作为Hadoop生态的元数据治理工具,通过Hive Hook、HDFS集成和Ranger联动实现深度整合,其核心能力在Hadoop环境下最为突出。源码分析显示,虽然核心引擎(repository/typesystem)与Hadoop无关,但addons目录专门处理Hadoop组

#apache#hadoop#大数据
【Atlas】Spark 作业的血缘能否被 Atlas 自动捕获?需要什么插件?

Apache Atlas与Spark血缘集成方案解析 核心结论 官方现状:Apache Atlas 2.4.0未提供内置Spark血缘捕获插件,与Hive的完整支持形成对比 技术原因:Spark动态执行特性导致血缘捕获复杂度高,社区资源有限 生产级解决方案 方案1:自研Spark Listener 原理:通过SparkListener接口捕获作业逻辑计划,解析输入输出关系 优点:灵活可控,支持字段

#spark#大数据#分布式
【Atlas】Atlas 是否支持跨系统的端到端血缘(如 Kafka → Flink → ClickHouse)?

摘要:Apache Atlas跨系统端到端血缘实现方案 本文详细解答了如何在Apache Atlas中实现Kafka→Flink→ClickHouse的跨系统端到端血缘追踪。虽然Atlas 2.4.0官方版本不直接支持该功能,但通过扩展Type System和自研Connector可实现生产级解决方案。文章包含元模型设计(定义ClickHouse表和Flink作业类型)、qualifiedName

#kafka#flink#clickhouse
【Atlas】Flink 作业是否支持与 Atlas 集成?如何上报血缘?

摘要:Apache Atlas 2.4.0 未提供原生 Flink 集成,但可通过自研 Connector 实现血缘管理。本文提出三大技术路径,重点推荐基于 FlinkAtlasReporter 的自研方案,通过解析 Source/Sink 配置构建 flink_process 实体并上报 Atlas。包含 Java 实现代码示例、作业集成方法和验证步骤,适用于需要精确追踪 Flink CDC 作

#flink#大数据
【Atlas】在 Flink CDC 场景下,如何将 MySQL 到 Kafka 再到 Hive 的端到端血缘上报至 Atlas?

Flink CDC端到端血缘追踪解决方案 摘要 本文介绍了一个完整的Flink CDC端到端血缘追踪方案,用于解决金融交易流水数据从MySQL到Kafka再到Hive的全链路元数据管理问题。方案基于Apache Atlas 2.4.0构建,包含三个核心组件: MySQL元数据注册:开发独立的Metadata Scanner定期扫描MySQL表结构并同步到Atlas; Flink CDC血缘捕获:通

#flink#mysql#kafka
【Atlas】如何开发一个自定义的 Spark Listener 将 DataFrame 操作上报到 Atlas?关键技术点是什么?

Spark Listener 与 Atlas 集成摘要 本文详细介绍了开发生产级自定义 Spark Listener 以捕获 DataFrame 操作并上报至 Apache Atlas 2.4.0 的完整方案。主要内容包括: 业务场景:解决 Hudi MOR 表增量血缘缺失问题,实现 Kafka-Hudi 数据流的完整血缘追踪 技术架构:基于 Spark QueryExecutionListene

#spark#linq#大数据
    共 70 条
  • 1
  • 2
  • 3
  • 7
  • 请选择