
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
今天在用pyspark的时候在一个类中调用rdd的map的时候报错,代码如下:rdd = df.filter(size(df.emission) > 50).\rdd.map(lambda row:hmm_learn(row, self._id))rdd.collect()运行的时候报错:pickle.PicklingError: Cannot pickle files
linux中关于IO操作有
最近做了一下pykafka的性能测试,主要涉及到use_greenlets、use_rdkafka、sync这三个参数。1. 测试的数据我用一个770MB的日志文件来作为测试数据,文件包含的行数为10175702 行。2. 测试的demo在写测试demo的时候遇到了几个问题,别看这么简单、很短的代码却也遇到了几个”棘手”的问题。#!env python#coding=utf-8#
Linux的system()和popen()差异1. system()和popen()简介在linux中我们可以通过system()来执行一个shell命令,popen()也是执行shell命令并且通过管道和shell命令进行通信。system()、popen()给我们处理了fork、exec、waitpid等一系列的处理流程,让我们只需要关注最后的返回结果(函数的返回值)即可。2. syste
最近用到了python-daemon这个库来使一个进程成为daemon进程,代码大致如下:#!env python#coding=utf-8import loggingimport multiprocessingimport logging.configimport daemonfrom test import wrapper2logger = Nonepool= Nonedef m
1. Python源码文件的编码Python源码文件的编码格式决定了在该源文件中声明的字符串(str和unicode)的编码格式,例如py源码如下:#!/usr/bin/env python# coding:utf-8if __name__ == '__main__':str='中文'print repr(str)如果文件保存为utf-8(vim 中用set fileencod
最近做了一下pykafka的性能测试,主要涉及到use_greenlets、use_rdkafka、sync这三个参数。1. 测试的数据我用一个770MB的日志文件来作为测试数据,文件包含的行数为10175702 行。2. 测试的demo在写测试demo的时候遇到了几个问题,别看这么简单、很短的代码却也遇到了几个”棘手”的问题。#!env python#coding=utf-8#
Python的星号(*、**)的作用1. 函数的可变参数当函数的参数前面有一个星号*的时候表示这是一个可变的位置参数,两个星号**表示是可变的关键字参数。#!env python#coding=utf-8#def foo(*args, **kwarg):for item in args:print itemfor k,v in kwarg.items():







