
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
组件角色MinIOS3 对象存储,Iceberg warehouseMySQLHMS 元数据 + 平台元数据表元数据,四个引擎共享同一份SQL 网关 + 批计算,引擎按需拉起Flink流引擎,每作业一个独立集群TrinoIceberg + 跨源联邦查询DorisOLAP,高并发点查 / 聚合Iceberg湖表格式,以 jar 进各引擎,非独立进程协调 / 消息 / 检索引擎的现代部署形态是 K8s
输入天生有上限的通道,不值得付 Spark 冷启动的税——但省掉引擎,就要用显式的架构边界把资源框死,超限拒绝而非截断;类型推断和装载解析必须同一套规则,decimal 不换 double,错误要带行号大声报;装载是单事务:要么全进要么全不进,失败清孤儿、不留空表。这条上传建表通道是「我的数据空间」的一部分——一套可私有化部署的数据平台,支持 OEM 合作。。
CDC 的失败点越靠后代价越高,「连接器协议对」不等于「这个实例真能做 CDC」,binlog 前提要在保存前真连源库探测;校验布两道:交互侧即时反馈,保存侧 fail-closed 收口,前端校验永远不算数;只自动化判定绝对可靠的检查项,格式不稳的(如 SHOW GRANTS)交给权威组件的原生报错。这条 MySQL → 数据湖的实时同步链路是「我的数据空间」的一部分——一套可私有化部署的数据平
国产库适配按内核家族收敛(Oracle 系/PG 系/MySQL 线协议),不是逐库硬写;元数据、入湖、直查是三个平面,放行标准逐级收紧,直查必须「引擎挂得上」先行;驱动可得性、形态覆盖(集中式/分布式、MySQL/Oracle 模式)、CDC 连接器有无,都要作为显式边界写进能力清单——信创场景的客户最反感「支持」两个字后面藏着一堆星号。这套多源接入能力是「我的数据空间」的一部分——一套可私有化
引擎原生 UI 无鉴权,NodePort/Ingress 直通不是「简陋」,是 RCE 与凭证泄露级别的攻击面;代理的安全内核就三件:作用域限定的凭证载体、判定与转发同一 canonical 路径、共享面白名单;响应体不改写,Location 与根绝对链接交给标准头处理,凭证靠代理层脱敏兜底——并且一定要用真浏览器验收。这套引擎可观测能力是「我的数据空间」的一部分——一套可私有化部署的数据平台,支
Notebook 的架构分水岭是「内核按什么拆」:按人拆进程简单,但成本随人头膨胀;按会话拆解释器,才能依赖装一次、算力共享;SQL 与 Python 的变量互通不是加一条桥接管道,而是让它们从头就在同一个进程里执行——最好的桥是不需要桥;「进程内多用户」的隔离清单要两层都列:Python 命名空间和Spark 会话态,漏掉后者会得到「不报错但算错数」;交互式的资源保护判据既不是「跑了多久」也不是
JDK 是 Iceberg 与 Spark 的共同前置,递进比一把梭风险可控得多,每步都能单独回滚;Iceberg 的可用上界由JDK 决定,不由发布页决定;字节码版本、shaded 与非 shaded 的依赖差异,都是编译期看不见的;Spark 4 把 procedure 收成原生 API 并在 analysis 阶段执行,凡是靠 analysis 之后的规则做鉴权的实现,在 4.x 上都会被绕
我的数据空间」实时计算实践笔记 · Flink SQL 系列。
Checkpoint 是流处理系统中保证故障恢复和数据一致性的重要机制。通常情况下, Flink 的每个算子都会维护自身的状态 (source operator 会保存消费的位点, window operator 保存中间的计算结果, sink operator 保存写入的事务 id) , 因此如果作业出现重启, Flink 作业直接从上一个位点重新消费即可。Checkpoint 间隔越小,作业重
我的数据空间」实时计算实践笔记 · Flink SQL 系列本文档介绍使用 Flink 流批模式下消费数据湖的一些关键点和细节。







