logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【Spark 核心内参】2025.12:从 Python UDF 的“AST 转译”到 K8s 的“突发感知”

的剪枝标识是**基于实例(Instance-based)**的。一旦规则导致节点替换,剪枝效果在当前转换路径上会局部失效。

#spark#大数据
【Spark 核心内参】2025.9:预览版常态化与数据类型的重构

Spark Connect 虽然有了 Python, Scala, Go, Rust 客户端,但大量现存的 BI 工具(Tableau, PowerBI, DBeaver)只认 JDBC。目前它们只能通过 Thrift Server 连接 Spark,无法享受 Connect 的架构优势。

#spark#大数据
【Spark 核心内参】2026.1:JIRA vs GitHub Issues 治理模式大讨论与 4.2.0 预览版首发

2026年的开篇,Spark 社区展现出了前所未有的变革活力。一方面,治理模式面临从传统的 JIRA 向现代 GitHub Issues 迁移的重大抉择,这不仅是工具的更替,更是社区开放度与治理效率的博弈;另一方面,Spark 4.2.0 预览版的发布以及关于 3.5 LTS 延长安全支持周期的深度辩论,彰显了社区在快速迭代与生产稳定性之间的平衡艺术。

#spark#大数据
【Spark 核心内参】2026.2:Spark 4.0.2 发布与 GitHub Issues 迁移大讨论

【Spark 核心内参】2026.2:Spark 4.0.2 发布与 GitHub Issues 迁移大讨论 航向追踪 Apache Spark 4.0.2 重要指数: ⭐⭐⭐⭐ 关键更新: 安全与正确性修复: 针对 branch-4.0 维护分支进行了大量修复,涵盖安全漏洞和计算正确性领域。版本推荐: 社区强烈建议所有使用 4.0 版本的用户升级到此版本或 4.1.1 版本。 主要影响: 显著提

#spark#大数据
【Spark】性能与联通性的终极博弈:Spark on K8s 主机网络改造深度实战

摘要:Spark on K8s主机网络改造实战 在Spark集群面临RMI跨系统调用和大规模Executor数据交换的性能瓶颈时,我们选择将Spark切换到K8s主机网络模式。然而这一改造遇到了K8s调度器与Spark动态端口机制的深层冲突:K8s的静态端口检查阻碍了Spark的端口重试机制。通过深入分析源码,我们利用AI辅助编程,开发了动态移除端口声明的插件,解决了调度问题。同时针对Spark

#spark#kubernetes#网络 +1
【Spark】性能与联通性的终极博弈:Spark on K8s 主机网络改造深度实战

摘要:Spark on K8s主机网络改造实战 在Spark集群面临RMI跨系统调用和大规模Executor数据交换的性能瓶颈时,我们选择将Spark切换到K8s主机网络模式。然而这一改造遇到了K8s调度器与Spark动态端口机制的深层冲突:K8s的静态端口检查阻碍了Spark的端口重试机制。通过深入分析源码,我们利用AI辅助编程,开发了动态移除端口声明的插件,解决了调度问题。同时针对Spark

#spark#kubernetes#网络 +1
【Spark 核心内参】2026.3:Auto CDC 声明式增量视图提案引爆社区,AI 代码自动化防御网关提上日程

Apache Spark社区近期动态频繁:4.2.0-preview3版本发布,增强Variant类型支持;针对PySpark供应链安全讨论依赖锁定方案;提议放弃对PyPy的支持以优化资源分配。重磅提案Auto CDC引发热议,旨在通过声明式增量视图简化CDC数据处理,被视为湖仓一体架构的关键突破。同时社区探讨Hive 4.x升级、AI代码自动化校验门控等议题,并推进CDC标准化接口。此外,Spa

#spark
【Spark 核心内参】2026.1:JIRA vs GitHub Issues 治理模式大讨论与 4.2.0 预览版首发

2026年的开篇,Spark 社区展现出了前所未有的变革活力。一方面,治理模式面临从传统的 JIRA 向现代 GitHub Issues 迁移的重大抉择,这不仅是工具的更替,更是社区开放度与治理效率的博弈;另一方面,Spark 4.2.0 预览版的发布以及关于 3.5 LTS 延长安全支持周期的深度辩论,彰显了社区在快速迭代与生产稳定性之间的平衡艺术。

#spark#大数据
【Spark 核心内参】2025.11:从 ANTLR 的“生态包袱”到远程 Shuffle 的“云原生解药”

核心共识:ANTLR 的版本不兼容问题是客观存在的严重隐患,Shade 是解决此类传递性依赖冲突的必要手段。虽然 Shade 会改变下游插件开发的依赖路径(包名变更),但这是为了系统整体稳定性必须付出的代价。后续行动 (Next Steps):推进 JIRA:继续推进 SPARK-53753 的代码合并。开发指引更新:需要明确告知 Spark SQL 插件开发者,未来在扩展语法时,需引用 Spar

#spark#大数据
[Docker] docker-compose安装neo4j社区版

找到目标镜像去docker-hub查询neo4j都有哪些镜像可选https://hub.docker.com/_/neo4j?tab=tags&page=1&ordering=last_updated这里我选择了neo4j:4.3.4-community这个版本,是目前最新的社区版docker-compose配置文件docker-compose文件version: '3.9'ser

    共 25 条
  • 1
  • 2
  • 3
  • 请选择