
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
a left join b 时,a是小表,b是超大表。那么就先对a中的join条件构造bloomfilter,broadcast到各个executor上,把超大表中的数据先剔除掉,这样就不会shuffle大量数据了。│ Build Side (小的一边) ││ e.g. song_base_info 750万 ││ 1. 扫一遍, 把 join key 全部塞进 BF▼│ BloomFilter
字节联合通信院编写的,如何构建企业自己的 data agent:https://blog.csdn.net/zhanggan25/article/details/153622642
退化维度是数据仓库维度建模中处理事务标识符的一种标准方法。它代表了那些在源系统中关联着丰富描述信息,但在维度模型中因描述信息已被提取到其他维度表而“退化”只剩下标识符本身的键。它的核心价值在于唯一标识事实记录,并提供链接回源OLTP系统的桥梁。理解并正确识别退化维度对于构建高效、清晰的星型/雪花型模型至关重要。
退化维度是数据仓库维度建模中处理事务标识符的一种标准方法。它代表了那些在源系统中关联着丰富描述信息,但在维度模型中因描述信息已被提取到其他维度表而“退化”只剩下标识符本身的键。它的核心价值在于唯一标识事实记录,并提供链接回源OLTP系统的桥梁。理解并正确识别退化维度对于构建高效、清晰的星型/雪花型模型至关重要。
今天使用Spark往Kafka中写数据,写入数据的时候配置了transactional.id,即事务性写入。一次性写入的数据量有点大,每次至少是30W+条数据,每条数据有十几个字段。任务经常会报如下错误:...







