logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Spark性能优化:资源调优篇

Spark性能优化:资源调优篇在开发完Spark作业之后,就该为作业配置合适的资源了。Spark的资源参数,基本都可以在spark-submit命令中作为参数设置。很多Spark初学者,通常不知道该设置哪些必要的参数,以及如何设置这些参数,最后就只能胡乱设置,甚至压根儿不设置。资源参数设置的不合理,可能会导致没有充分利用集群资源,作业运行会极其缓慢;或者设置的资源过大,队列没有足够的资源来提供

#spark#性能优化#集群
spark RDD ,wordcount案例解析

spark RDD,wordcount案例解析spark RDD 内存计算模型数据来源:可以从HDFS文件,Hive表,Hbase,本地磁盘,MQspark集群,RDD中的数据都是存放在worker,都分区的,你就可以简单的理解为worker就是分区,一个worker里面可以有多个partitionMaster 主节点将rdd划分为3个patition,存放数据源,在worker迭代

#spark#hbase#集群
Spark SQL 集成ElasticSearch的案例实战

Spark SQL 集成ElasticSearch的案例实战ElasticSearch 概念回顾ElasticSearch是一个基于Lucene的搜索服务器。它提供了一个分布式多用户能力的全文搜索引擎,基于RESTful web接口。Elasticsearch是用Java开发的,并作为Apache许可条款下的开放源码发布,是当前流行的企业级搜索引擎。设计用于云计算中,能够达到实时搜索,稳定,可

#spark#云计算#apache +2
Python 爬虫笔记(三)

#用正则表达式爬取图片#! /usr/bin/env python#coding=utf-8import urllib2importrefrombs4 importBeautifulSouphtml=urllib2.urlopen("http://www.pythonscraping.com/pages/page3.html")bsObj=BeautifulSoup(ht

#python#爬虫#正则表达式
Python 爬虫笔记(由站内到站外爬虫)

#! /usr/bin/env python#coding=utf-8import urllib2frombs4 importBeautifulSoupimportreimport datetimeimport randompages=set()random.seed(datetime.datetime.now())#Retrieves a list of all In

#python#爬虫
Python 爬虫笔记(获取整个站点中的所有外部链接)

#! /usr/bin/env python#coding=utf-8import urllib2frombs4 importBeautifulSoupimportreimport datetimeimport randompages=set()random.seed(datetime.datetime.now())#Retrieves a list of all In

#python#爬虫
大数据之hadoop【hdfs】

目录1、HDFS体系结构2、HDFS Shell操作3、HDFS Java API4、HDFS和RPC5、HDFS High Availability6、HDFS数据回收和简单运维==============================================================HadoopHDFS

#大数据#hadoop#java
Python 爬虫笔记(对维基百科页面的深度爬取)

*#! /usr/bin/env python#coding=utf-8import urllib2frombs4 importBeautifulSoupimportreimport datetimeimport randomrandom.seed(datetime.datetime.now())def getLinks(articleUrl):ht

#python#爬虫#正则表达式
到底了