logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

数据湖架构之Hudi编译篇

说起编译hudi,从第一遍过之后,再回过头来看,发现就是第一遍不熟悉,出现的一切问题可以总结为maven仓库没配置好。一开始我只是配置了阿里云仓库,但是后面不断报错,然后百度谷歌找原因,再调整配置,再编译,最后就成功了,所以整体来说编译不复杂,只要配置正确,那我把最后可以通过的配置贴出来,这也是我觉得可以帮助到大部分同学的地方。hudi迭代还是比较快的,因为同时也依赖了hadoop和spark,为

#架构#java#maven
Spark 3.5.1 升级 Java 17 异常 cannot access class sun.nio.ch.DirectBuffer

使用Spark 3.5.1 升级到Java17的时候会有一个异常,异常如下。

文章图片
#spark#java#nio
数仓面试重灾区之-Generic User-defined Table Generating Function(UDTF)

前言UDTF 这玩意对数仓同学来讲,熟悉又陌生,主要一方面是大量接触,另一方面是理解上有误导,还一个就是不是太明白里头到底咋回事。场景切入关于UDTF面试场景大概有以下的问题:1、hive的udf你了解么,常用都有哪些类型2、行专列操作了解么,里头是怎么实现的3、比较直白的问法,udtf你了解么4、关于hive的优化方式,udtf其实是考察之一背后的原因:1、首先实际线上滥用很多,数据膨胀、倾斜等

文章图片
#面试#hive#职场和发展
在docker中玩flink时候记录一些组合命令

玩docker的时候记录一些组合命令,一方面是可以直接拿上来使用,还有的话也可以拿过来改改,主要是我自己有这种经历,过一阵子我自己也忘,与其去搜人家的博客还不如自己记录一把。好了,没啥所谓的规律性,就是一些日常经常使用的命令组合。

文章图片
#docker#flink#容器
hive-3.0.0源码编译详解

前言看我往期文章的朋友都会发现我聊SQL的时候喜欢拿一份Hive的源码来做参考,其实在我看来,对于技术人员来说,源码其实就是最好的参考资料了,不管是网络上面有的或者没有的,源码都可以给你最原汁原味的解释。Hive版本3.x其实出来很久了,本文结合编译的过程,顺便聊聊编译的那些事。准备工作在入手一份源码之前,首先要知道源码是从哪里可以搞到,hive代码首先是可以在github上面下载的,搜索关键字

#hive#hadoop#数据仓库
全民上手大模型--ollama+langchain+通义千问零费用java+python跑通本机大模型

写本篇文章是因为我经历过了各种付费+测试之后很艰难想入手大模型,国内的同学学技术还是太困难了,但是看到市面上各种火爆,实在有按捺不住想体验,终于迎来了一个契机。在此之前,应该大家都了解OpenAPI,确实强大,但是国内用户来说,有以下问题:一、网络不通,这里还不是简单的翻墙的问题,是他的网站都不对中国大陆开放,政治因素就不谈了二、贵这玩意其实是按调用次数收费的,厉害点的功能其实都要收费,还是美元三

文章图片
#java#python#人工智能
解锁Hudi+Spark:大数据处理的超强组合拳

在大数据领域,数据的存储和处理是两大核心任务。Hudi(Hadoop Upserts Delete and Incremental)作为一种新兴的数据湖存储框架,正逐渐崭露头角,它为大规模数据集提供了高效的增量数据处理和实时数据更新能力。而 Spark,作为大数据处理领域的明星框架,以其快速的内存计算、丰富的 API 和强大的分布式处理能力,在批处理、流处理以及机器学习等多个场景中广泛应用。

文章图片
#spark#大数据#分布式
全民上手大模型--ollama+langchain+通义千问零费用java+python跑通本机大模型

写本篇文章是因为我经历过了各种付费+测试之后很艰难想入手大模型,国内的同学学技术还是太困难了,但是看到市面上各种火爆,实在有按捺不住想体验,终于迎来了一个契机。在此之前,应该大家都了解OpenAPI,确实强大,但是国内用户来说,有以下问题:一、网络不通,这里还不是简单的翻墙的问题,是他的网站都不对中国大陆开放,政治因素就不谈了二、贵这玩意其实是按调用次数收费的,厉害点的功能其实都要收费,还是美元三

文章图片
#java#python#人工智能
failed to solve with frontend dockerfile.v0: failed to create LLB definition: unexpected status code

【代码】failed to solve with frontend dockerfile.v0: failed to create LLB definition: unexpected status code。

文章图片
#docker
大数据平台治理——运营的角度看数仓

前言三分靠技术,七分靠管理,其实一直就是技术岗位的现状,事实上在一个完整的互联网产业结构中,除了本身的软件性能和软件设计的优雅追求,还有着业务的持续运营以及背后的商业模式的运作。分析师的工作更多的就是指导业务的运营以及商业上成本的考量,以便为进一步的决策提供数据参考,本文就从一个数据分析师的角度去聊一下数仓的治理。分析框架开局一张图我们说一个数仓的好与坏不是单纯的某个地方的好与坏,而是通过从左看右

#自然语言处理#人工智能#big data
    共 80 条
  • 1
  • 2
  • 3
  • 8
  • 请选择