logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大数据去重必学:Bitmap与布隆过滤器,看完秒懂核心原理

对比维度Bitmap(位图)布隆过滤器(Bloom Filter)核心定位海量整数去重、快速排序海量元素存在性判断依赖基础单个位映射,无哈希函数(或单个)多个哈希函数 + Bitmap空间效率高(依赖元素ID范围)极高(不依赖ID范围)误判率无(映射唯一时)有(可通过调整哈希函数个数降低)支持删除支持(重置对应位为0)不支持适用场景整数去重、亿级排序缓存穿透、黑名单、存在性校验。

文章图片
#大数据
大数据开发在AI平台的核心工作+AI提效全攻略

无论是单表、单任务新增字段,还是全链路新增字段,只需告诉AI“在哪个任务里新增哪个数据源的哪个字段”,AI就能一键完成:代码逻辑编写、语法检测、逻辑纠正、目标表结构调整,人工只需完成Review,即可上线。:新建表时,数仓开发写完代码后,需要根据字段上游数据类型、描述信息、加工口径,手动填写表的元数据(字段名、类型、描述),尤其是大型需求,一次性新增几十、上百个字段,极其耗费人力。在日常开发中,我

文章图片
#大数据#人工智能
Spark 4.0 重磅升级:湖仓处理性能再突破

VARIANT 类型解决半结构化数据的存储与查询效率问题SQL UDF消除跨进程调用开销PySpark 增强让 Python 工程师告别语言切换管道语法提升 SQL 可维护性性能整体提升 30%,大规模湖仓场景收益最为明显建议在非生产环境优先验证 JDK 17 兼容性后,再推进版本迁移。

文章图片
#大数据
Spark 4.0 重磅升级:湖仓处理性能再突破

VARIANT 类型解决半结构化数据的存储与查询效率问题SQL UDF消除跨进程调用开销PySpark 增强让 Python 工程师告别语言切换管道语法提升 SQL 可维护性性能整体提升 30%,大规模湖仓场景收益最为明显建议在非生产环境优先验证 JDK 17 兼容性后,再推进版本迁移。

文章图片
#大数据
AI Coding项目效率翻倍的秘诀

AI编码工具的正确使用姿势 摘要:本文揭示了AI编码工具产出质量低下的核心原因——上下文信息不足。关键在于创建精简有效的AGENTS.md文件(200行以内),只包含关键规则和架构导航,而非冗长文档。文章提出仓库聚合方案打破前后端割裂,并强调验证闭环的重要性:通过脚本化请求+断言确保接口可用性。同时推荐将质量检查接入CI/CD流水线,实现从代码提交到部署的自动化验证。最后提供了AGENTS.md的

文章图片
#人工智能
AI Coding项目效率翻倍的秘诀

AI编码工具的正确使用姿势 摘要:本文揭示了AI编码工具产出质量低下的核心原因——上下文信息不足。关键在于创建精简有效的AGENTS.md文件(200行以内),只包含关键规则和架构导航,而非冗长文档。文章提出仓库聚合方案打破前后端割裂,并强调验证闭环的重要性:通过脚本化请求+断言确保接口可用性。同时推荐将质量检查接入CI/CD流水线,实现从代码提交到部署的自动化验证。最后提供了AGENTS.md的

文章图片
#人工智能
大数据开发在AI平台的核心工作+AI提效全攻略

无论是单表、单任务新增字段,还是全链路新增字段,只需告诉AI“在哪个任务里新增哪个数据源的哪个字段”,AI就能一键完成:代码逻辑编写、语法检测、逻辑纠正、目标表结构调整,人工只需完成Review,即可上线。:新建表时,数仓开发写完代码后,需要根据字段上游数据类型、描述信息、加工口径,手动填写表的元数据(字段名、类型、描述),尤其是大型需求,一次性新增几十、上百个字段,极其耗费人力。在日常开发中,我

文章图片
#大数据#人工智能
数据安全-面试题

数据安全相关面试题

文章图片
    共 15 条
  • 1
  • 2
  • 请选择