logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

spark 3.3+ 之BloomFilter Runtime Filter

a left join b 时,a是小表,b是超大表。那么就先对a中的join条件构造bloomfilter,broadcast到各个executor上,把超大表中的数据先剔除掉,这样就不会shuffle大量数据了。│ Build Side (小的一边) ││ e.g. song_base_info 750万 ││ 1. 扫一遍, 把 join key 全部塞进 BF▼│ BloomFilter

#spark#大数据#分布式
2025数据智能体实践指南——回归商业本质:数据智能体价值主张与务实路径

字节联合通信院编写的,如何构建企业自己的 data agent:https://blog.csdn.net/zhanggan25/article/details/153622642

#大数据
数据仓库中的退化维度

退化维度是数据仓库维度建模中处理事务标识符的一种标准方法。它代表了那些在源系统中关联着丰富描述信息,但在维度模型中因描述信息已被提取到其他维度表而“退化”只剩下标识符本身的键。它的核心价值在于唯一标识事实记录,并提供链接回源OLTP系统的桥梁。理解并正确识别退化维度对于构建高效、清晰的星型/雪花型模型至关重要。

#数据仓库
数据仓库中的退化维度

退化维度是数据仓库维度建模中处理事务标识符的一种标准方法。它代表了那些在源系统中关联着丰富描述信息,但在维度模型中因描述信息已被提取到其他维度表而“退化”只剩下标识符本身的键。它的核心价值在于唯一标识事实记录,并提供链接回源OLTP系统的桥梁。理解并正确识别退化维度对于构建高效、清晰的星型/雪花型模型至关重要。

#数据仓库
Kafka事务报错之 Producer attempted an operation with an old epoch

今天使用Spark往Kafka中写数据,写入数据的时候配置了transactional.id,即事务性写入。一次性写入的数据量有点大,每次至少是30W+条数据,每条数据有十几个字段。任务经常会报如下错误:...

#kafka
到底了