logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

windows下 的kettle的安装与配置

kettle的安装与使用(windows下)亲测关于报错请下滑到末尾,有我遇到的错误,及其解决方案环境windows 10系统cdh集群 (版本号是5.10)步骤下载安装kettle如何下载百度搜索kettle会出现kettle的官网,在官网上面下载就好了!地址:kettle 8.2下载地址下载可能会有点慢,在这个过程当中,我的任务还失败了一次,然后我选择了使用迅雷...

#etl#大数据
python利用jupyter连接spark之后如何设置集群资源

jupyter 如何连接sparkjupyter连接spark有两种方式:第一种: 利用findspark这个包首先常规的启动jupyter这个服务,然后在python程序里面import findsparkfindspark.init(args) #这个args要指明SPARK_HOME 例如:findspark.init("/usr/local/spark")from pysp...

#jupyter#python
【spark】join异常分析(逻辑问题)

spark join 数据表关系从多对一,变成了多对多

#spark#大数据#分布式
Spark 连接kafka报错: Error while fetching metadata with correlation id xx [topicName=INVALID_REPLICATIO]

问题来源同事在一次spark程序中,通过spark在kafka中的topic中写入数据发生报错,错误日志如下:2021-01-25 19:58:11,794 INFO utils.AppInfoParser: Kafka version : 2.0.0-cdh6.1.12021-01-25 19:58:11,794 INFO utils.AppInfoParser: Kafka commitId

Python:设置 Pandas的dataFrame的index索引起始值为1

设置 python的pandas的dataFrame的索引值从1开始假设有一个dataFrame:这里的index的索引列是从0开始的,那么现在我想要让它从1开始怎么做?我搜了几篇文章,发现有的是:df.index = range(len(df))//这样的data_df = pd.DataFrame({'a':a,},index=list(range(1,n)))//这种是创...

到底了