
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
参考资料https://blog.csdn.net/UbuntuTouch/article/details/99702199需求最近在做日志收集到es时遇到些问题。我不想用logstash做日志的切分,毕竟很大,想用FileBeat直接推数据到es中。这就涉及到一个问题,这步切分数据在哪做。这个可以使用es的ingest node来做。解决ingest nodees在5.0X以后推出了ingest
参考资料:https://zhuanlan.zhihu.com/p/115888408(真的很不错的文章,受益匪浅)前言Executor 内存管理方面讲解的很多,今天第一次细细来学习一下内存管理相关我觉得理解可以让我们更对于广播变量以及缓存包括shuffle有些更好的控制和理解spark在yarn模式下运行的时候,其申请的资源是以container的形式存在的。最大资源申请受yarn.schedu
参考资料https://zhuanlan.zhihu.com/p/137471443前言众所周知,我们一直在用spark-submit 来提交任务,在yarn 见面的Allocated Memory可以看到yarn总共的占用内存。以及启动的Containers。那具体的内存占用情况却没有显示那么清楚,今天来具体分析一下这一块。1、基本概念1、spark相关1、spark.driver.memory
参考资料:https://github.com/apache/spark/pull/22219https://forums.databricks.com/questions/344/how-does-the-jdbc-odbc-thrift-server-stream-query.html背景我们是使用sparkThriftserver作为BI的底层作为查询,当我们的平台多人操作查询的时...
背景decimal进行相关计算的时候精度会缺失,比如 字段a decimal(38,18)字段b decimal(38,18)a+b产生的数据类型就是出现decimal(38,17) 这种情况解决在spark.2.3.2 版本以上确实会出现以上的问题解决办法是添加配置spark.sql.decimalOperations.allowPrecisionLossfalse...
背景我们自己平台的产品发现指定的mysql数据库后台发现连接非常多,过多的连接对于数据库是一种负担。这些连接完成SQL执行任务后空闲着啥事也不干,白白占用内存资源,如果这些连接堆积起来,将导致MySQL超过最大连接数,从而无法新建MySQL连接,有可能导致“Too many connections”的错误。解决1、一反馈连接多,我第一件事是查看mysql现在到底有多少连接。SELECT count
前言我这里只是专注于生成CSV等测试数据文件每次构造测试数据的时候就很头疼,之前自己简单造个两三行还行,造多了就有些费脑细胞了,抽出些时间来专门找一下有没有相应工具小数据量测试数据小数据量测试数据使用在线的网站就行,10W以内的数据基本都没得问题https://www.onlinedatagenerator.com/大数据量的测试数据大数据量的测试数据文件,我找到一个使用的 github项目htt
背景我们自己平台的产品发现指定的mysql数据库后台发现连接非常多,过多的连接对于数据库是一种负担。这些连接完成SQL执行任务后空闲着啥事也不干,白白占用内存资源,如果这些连接堆积起来,将导致MySQL超过最大连接数,从而无法新建MySQL连接,有可能导致“Too many connections”的错误。解决1、一反馈连接多,我第一件事是查看mysql现在到底有多少连接。SELECT count
之前连接的好好的,突然xshell连接虚拟机就连接不上了找了一顿,发现问题。我们本机都有2个网卡 无线的和有线的 以太网适配器就是你的网卡连网线用的,无线局域网适配器是你的无线网卡连WIFI用的,如下图,他们都有自己的ip,注意:当无线网络换的时候,他的ip会发生变化,所以网段也会发生变化。所以问题就出在这里,我搬家的时候路由换了,但是虚拟机的ip就没有及时换过来,造成了ssh连接不







