logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

spark报错Initial job has not accepted any resources; check your cluster UI to ensure that workers are

报错:Initial job has not accepted any resources; check your cluster UI to ensure that workers are registered and have sufficient resources我在jupyter notebook中以:spark = SparkSession.builder.master('spark:

#spark
pyspark学习41:用正则表达式过滤dataframe的指定列

创建一个dataframe:df = spark.createDataFrame([("a", 1), ("b", 2), ("c", 3)], ["Col1","a"])

#正则表达式#spark#big data
pyspark学习:GroupedData 对象

对应课件3.4apply(udf)该方法使用pandas中的用户自定义函数作用在GroupedData的每一组数据之上,返回结果作为一个DataFrame。udf用户自定义函数接收pandas.DataFrame作为参数,返回另外一个pandas.DataFrame对象。这个方法是pyspark2.3中加入的新方法。其通过@pandas_udf表示这是一个pandas的方法,参数为id long,

#python#pycharm
spark-Standalone 三种运行模式

一、驱动driver在集群运行模式, 以cluster方式提交时,port最好设置为6066,因为这种方式提交时,是以rest api方式提交applicationbin/spark-submit \--class org.apache.spark.examples.SparkPi \--master spark://hadoop101:6066 \--deploy-mode cluster --

#spark#scala#big data
spark读取文件 报错:py4j.protocol.Py4JJavaError

# read data from hdfs and transform RDD[Row]page_views_rdd = sc\.textFile("/user/hive/warehouse/page_views")\.map(map_func)# Create DataFramepage_views_df = sqlContext.createDataFrame(page_views_rdd)原

#spark
pyspark中:DataFrame' object has no attribute 'map'

在对 pyspark的sparksql 代码中测试中, 在spark1.6中使用dataframe的map对象时,如下代码session_pv = sqlContext.sql("""SELECT session_id,COUNT(1) AS cnt FROM tmp_page_views GROUP BY session_id ORDER BY cnt DESC LIMIT 20""")\...

#spark
hadoop中的Name node is in safe mode的解决方法

hadoop集群长期待机,过程中由于硬盘快用了,导致集群进入安全模式,再次启动hive的时候出现以下错误提示:Cannot create directory /tmp/hive/usr100/58b61340-fdb6-434c-be24-2f8f23fc524e. Name node is in safe mode.Resources are low on NN. Please add o...

#hadoop
搭建hadoop集群常见坑二:hadoop集群中namenode启动不起来的成因和二种解决方法

hadoop集群中namenode启动不起来如何解决新手在初次搭建hadoop集群中经常遇到namenode或者databode启动不起来,大概率是因为多次格式化NameNode造成的。因为吗每格式化一次NameNode,就会产生新的集群id...

#hadoop
Hive 中数据仓库默认位置配置及库表关系

1、原始位置的默认配置hive中的Default(默认)数据仓库的最原始位置是在hdfs上的 /user/hive/warehouse(以下默认Hive的HDFS根目录为/user/hive)路径下,这个原始位置是hive-default.xml.template文件默认配置的,2、库表关系1)默认情况下:在hdfs目录下,没有对默认的数据库default创建文件夹。如果某张表属于...

#hdfs#hive#spark
    共 15 条
  • 1
  • 2
  • 请选择