logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

pyspark使用

在处理同一批数据(130w条样本测试)时,使用pyspark(local模式)处理需要0.05s,而pandas的apply函数则需要15s,快了300倍!pandas的自定义函数applyreturn 1else:return 0pyspark的自定义函数udf。

#spark
pyspark使用

在处理同一批数据(130w条样本测试)时,使用pyspark(local模式)处理需要0.05s,而pandas的apply函数则需要15s,快了300倍!pandas的自定义函数applyreturn 1else:return 0pyspark的自定义函数udf。

#spark
一个python 脚本将XML文件转换到excel

需要下载一个module:xlwt,如下是source code  import xml.dom.minidomimport xlwtimport syscol = 0row = 0   def handle_xml_report(xml_report, excel):       problems = xml_report.getElementsByT

到底了