logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

一台机器跑起整套湖仓:k3s 部署 Kyuubi/Spark/Iceberg/Doris 怎么做对

组件角色MinIOS3 对象存储,Iceberg warehouseMySQLHMS 元数据 + 平台元数据表元数据,四个引擎共享同一份SQL 网关 + 批计算,引擎按需拉起Flink流引擎,每作业一个独立集群TrinoIceberg + 跨源联邦查询DorisOLAP,高并发点查 / 聚合Iceberg湖表格式,以 jar 进各引擎,非独立进程协调 / 消息 / 检索引擎的现代部署形态是 K8s

#spark#大数据#分布式
不起 Spark,把 CSV/Excel 直接写成 Iceberg 表:10 万行 2~5 秒

输入天生有上限的通道,不值得付 Spark 冷启动的税——但省掉引擎,就要用显式的架构边界把资源框死,超限拒绝而非截断;类型推断和装载解析必须同一套规则,decimal 不换 double,错误要带行号大声报;装载是单事务:要么全进要么全不进,失败清孤儿、不留空表。这条上传建表通道是「我的数据空间」的一部分——一套可私有化部署的数据平台,支持 OEM 合作。。

#spark#大数据
Flink CDC 建好了却同步不出数据:别等作业跑起来才发现 binlog 没开

CDC 的失败点越靠后代价越高,「连接器协议对」不等于「这个实例真能做 CDC」,binlog 前提要在保存前真连源库探测;校验布两道:交互侧即时反馈,保存侧 fail-closed 收口,前端校验永远不算数;只自动化判定绝对可靠的检查项,格式不稳的(如 SHOW GRANTS)交给权威组件的原生报错。这条 MySQL → 数据湖的实时同步链路是「我的数据空间」的一部分——一套可私有化部署的数据平

#flink#大数据
国产数据库怎么接进数据湖:达梦/人大金仓/openGauss/GaussDB/OceanBase 接入实录

国产库适配按内核家族收敛(Oracle 系/PG 系/MySQL 线协议),不是逐库硬写;元数据、入湖、直查是三个平面,放行标准逐级收紧,直查必须「引擎挂得上」先行;驱动可得性、形态覆盖(集中式/分布式、MySQL/Oracle 模式)、CDC 连接器有无,都要作为显式边界写进能力清单——信创场景的客户最反感「支持」两个字后面藏着一堆星号。这套多源接入能力是「我的数据空间」的一部分——一套可私有化

#数据库#oceanbase
Spark/Flink 的 Web UI 不能裸奔:多租户平台的鉴权反向代理设计

引擎原生 UI 无鉴权,NodePort/Ingress 直通不是「简陋」,是 RCE 与凭证泄露级别的攻击面;代理的安全内核就三件:作用域限定的凭证载体、判定与转发同一 canonical 路径、共享面白名单;响应体不改写,Location 与根绝对链接交给标准头处理,凭证靠代理层脱敏兜底——并且一定要用真浏览器验收。这套引擎可观测能力是「我的数据空间」的一部分——一套可私有化部署的数据平台,支

#spark#flink#前端
一个 Spark Driver 跑多人 Notebook:内核多路复用与并发隔离怎么做对

Notebook 的架构分水岭是「内核按什么拆」:按人拆进程简单,但成本随人头膨胀;按会话拆解释器,才能依赖装一次、算力共享;SQL 与 Python 的变量互通不是加一条桥接管道,而是让它们从头就在同一个进程里执行——最好的桥是不需要桥;「进程内多用户」的隔离清单要两层都列:Python 命名空间和Spark 会话态,漏掉后者会得到「不报错但算错数」;交互式的资源保护判据既不是「跑了多久」也不是

#spark#大数据#分布式
Spark 3.5 升 4.1.3 实录:Iceberg 1.11 的 class 61、JDK 17 底座、CALL 鉴权前置到 parser

JDK 是 Iceberg 与 Spark 的共同前置,递进比一把梭风险可控得多,每步都能单独回滚;Iceberg 的可用上界由JDK 决定,不由发布页决定;字节码版本、shaded 与非 shaded 的依赖差异,都是编译期看不见的;Spark 4 把 procedure 收成原生 API 并在 analysis 阶段执行,凡是靠 analysis 之后的规则做鉴权的实现,在 4.x 上都会被绕

#spark#java#大数据
FlinkSQL 处理 binlog:changelog 的三种处理方式

我的数据空间」实时计算实践笔记 · Flink SQL 系列。

#大数据#flink
Flink checkpoint 间隔怎么定:写 Iceberg 为什么是 5~15 分钟,秒级为什么不划算

Checkpoint 是流处理系统中保证故障恢复和数据一致性的重要机制。通常情况下, Flink 的每个算子都会维护自身的状态 (source operator 会保存消费的位点, window operator 保存中间的计算结果, sink operator 保存写入的事务 id) , 因此如果作业出现重启, Flink 作业直接从上一个位点重新消费即可。Checkpoint 间隔越小,作业重

#flink#大数据
Flink 流批一体读 Iceberg:snapshot 区间的参数矩阵与 V2 表的读取约束

我的数据空间」实时计算实践笔记 · Flink SQL 系列本文档介绍使用 Flink 流批模式下消费数据湖的一些关键点和细节。

#flink#服务器#数据库
    共 12 条
  • 1
  • 2
  • 请选择