logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Flink HBase SQL Connector RowKey/列族映射、Upsert 语义、Lookup 维表、缓存与写入缓冲

本文介绍了 Flink 连接 HBase 的关键配置要点:1) HBase 始终以 Upsert 模式运行,必须定义 rowkey 作为主键;2) 列族需声明为 ROW 类型,支持选择性映射;3) 写入时需用 ROW() 构造列族值,可配置 NULL 值处理;4) 支持扫描查询和维表 Join,可开启异步查询提升性能;5) 提供写入缓冲、Lookup 缓存等优化参数,并支持 HBase 原生配置透

#flink#hbase#sql
Flink FileSystem SQL Connector 分区文件表、目录监听、滚动策略、Compaction 与 Partition Commit(避坑指南)

本文详细介绍了 Flink FileSystem SQL Connector 的核心功能和使用方法。该连接器支持访问本地、HDFS、S3等文件系统,内置在 Flink 中无需额外依赖。重点内容包括: 分区表定义与 Hive 风格目录结构 源端配置(一次性扫描/持续监听) 文件元数据列的使用技巧 写入机制(滚动策略、文件格式差异) 小文件合并功能及注意事项 分区提交策略(process-time/p

#flink#sql#大数据
Flink Print SQL Connector最强“肉眼调试”Sink,用对真的省一半时间

本文介绍了Flink Print Connector的使用方法和排障技巧。主要内容包括:1) 最小可用DDL语法;2) 输出格式解析,重点说明RowKind标识符(+I/-D/-U/+U)的含义;3) print-identifier参数在多并行任务中的日志区分作用;4) 将输出重定向到stderr的生产实践;5) 通过sink.parallelism控制打印并行度;6) DataGen与Prin

#flink#sql#java
Flink BlackHole SQL Connector /dev/null 式“吞数据”Sink,压测与验证的神器

Flink黑表(BlackHole)是一种特殊的连接器,用于性能测试和瓶颈分析。它完全丢弃数据而不输出,适合压测场景。主要用途包括:1) 替换真实sink快速判断性能瓶颈是否来自外部系统;2) 与DataGen组合进行SQL极限吞吐测试;3) 与Print表配合使用(Print验证数据正确性,BlackHole测试性能)。在生产排障中,通过切换为黑表可以快速定位瓶颈来源(计算逻辑还是外部系统)。注

#flink#sql#数据库
Flink SQL 压测最短闭环Print 验证正确性 + BlackHole 榨干性能上限(附 Join/Agg/TopN/UDF 模板)

本文介绍了如何通过Print和BlackHole两种方式高效测试Flink SQL的性能和正确性。Print适合小流量验证SQL逻辑的正确性,而BlackHole则用于大流量测试SQL的计算吞吐上限。文章提供了详细的测试步骤,包括创建测试表、数据生成、SQL模板以及关键指标监控方法,帮助开发者快速定位性能瓶颈。最后给出了完整的测试清单,确保测试过程全面可靠。这种方法能显著提高SQL调优效率,减少生

#flink#sql#大数据
Flink DataGen SQL Connector 本地造数、压测、边界数据与“像真数据”的生成技巧

本文详细介绍了Flink DataGen连接器的使用技巧,包括核心概念(bounded/unbounded)、常用参数配置(控速/有界/并行)、字段级定制方法(随机/序列/NULL注入)、特殊类型处理(字符串/集合)以及高级用法(LIKE复制表结构)。重点讲解了如何模拟真实数据场景,提供了压测和脏数据测试的配方模板,并总结了常见易错点,如字段长度限制、序列类型边界效应等。该指南适合需要快速生成测试

#flink#sql#大数据
Flink HBase SQL Connector RowKey 设计、Upsert 语义、维表 Join、缓存与写入调优

Flink SQL 连接 HBase 采用 Upsert 模式,必须定义 rowkey 字段作为主键。数据映射规则要求列族声明为 ROW 类型,rowkey 为原子字段。写入时需用 ROW(...) 构造列族值,读取支持 Scan 和维表 Join。生产环境中需重点优化 RowKey 设计以避免热点问题,可采用 Hash/Salt 前缀或倒排时间等方法。此外需关注一致性、幂等性、写入调优及 Loo

#flink#hbase#sql
Flink × Hive HiveCatalog 一键接入元数据,Flink 直接读写 Hive 表

HiveCatalog用于元数据共享管理,适合多团队协作场景;直接读写Hive表则用于数据流转场景。版本支持上需注意Hive 2.3.x和3.1.x系列,推荐使用Flink官方提供的bundled connector避免依赖冲突。实际使用中需配置Hadoop环境,通过SQL Client创建HiveCatalog后可实现跨会话表定义复用。典型问题包括Hadoop类缺失、Metastore连接失败和

#flink#hive#大数据
Flink + Hive Functions HiveModule、原生聚合加速、复用 Hive UDF/UDTF/UDAF

本文介绍了Flink集成Hive函数的关键技术点。HiveModule允许在Flink中直接调用Hive内置函数,但需注意线程安全问题。1.17版本引入的native聚合函数支持hash聚合优化性能,可通过配置开关启用。Flink能自动转换Hive的UDF/UDTF/UDAF等函数,实现代码复用。生产实践中建议进行正确性和性能验证,特别关注UDTF扩行和聚合函数优化场景。使用时需确保满足HiveC

#flink#hive#大数据
Flink Hive 把 Hive 表变成“可流式消费”的数仓底座

本文介绍了Flink与Hive集成的核心功能和使用场景。主要内容包括:1)Hive作为数据源,支持批量和流式读取,可监控新增分区或文件;2)Hive作为维表,实现实时数仓中的Temporal Join;3)写入Hive的方式,批处理支持覆盖写入,流处理通过分区提交策略逐步可见数据;4)性能优化技巧,如向量化读取、并行度推断等;5)注意事项,如原子性要求、分区爆炸风险、对象存储的Exactly-on

#flink#hive#大数据
    共 635 条
  • 1
  • 2
  • 3
  • 64
  • 请选择