编程 Python

在Python中利用Pandas库处理大数据的简单介绍

Posted in Python onApril 07, 2015

在数据分析领域，最热门的莫过于Python和R语言，此前有一篇文章《别老扯什么Hadoop了，你的数据根本不够大》指出：只有在超过5TB数据量的规模下，Hadoop才是一个合理的技术选择。这次拿到近亿条日志数据，千万级数据已经是关系型数据库的查询分析瓶颈，之前使用过Hadoop对大量文本进行分类，这次决定采用Python来处理数据：

    硬件环境
        CPU：3.5 GHz Intel Core i7
        内存：32 GB HDDR 3 1600 MHz
        硬盘：3 TB Fusion Drive
    数据分析工具
        Python：2.7.6
        Pandas：0.15.0
        IPython notebook：2.0.0

源数据如下表所示：

数据读取

启动IPython notebook，加载pylab环境：

ipython notebook --pylab=inline

Pandas提供了IO工具可以将大文件分块读取，测试了一下性能，完整加载9800万条数据也只需要263秒左右，还是相当不错了。

import pandas as pd
reader = pd.read_csv('data/servicelogs', iterator=True)
try:
df = reader.get_chunk(100000000)
except StopIteration:
print "Iteration is stopped."

在Python中利用Pandas库处理大数据的简单介绍

使用不同分块大小来读取再调用 pandas.concat 连接DataFrame，chunkSize设置在1000万条左右速度优化比较明显。

loop = True
chunkSize = 100000
chunks = []
while loop:
  try:
    chunk = reader.get_chunk(chunkSize)
    chunks.append(chunk)
  except StopIteration:
    loop = False
    print "Iteration is stopped."
df = pd.concat(chunks, ignore_index=True)

下面是统计数据，Read Time是数据读取时间，Total Time是读取和Pandas进行concat操作的时间，根据数据总量来看，对5~50个DataFrame对象进行合并，性能表现比较好。

在Python中利用Pandas库处理大数据的简单介绍

如果使用Spark提供的Python Shell，同样编写Pandas加载数据，时间会短25秒左右，看来Spark对Python的内存使用都有优化。
数据清洗

Pandas提供了 DataFrame.describe 方法查看数据摘要，包括数据查看（默认共输出首尾60行数据）和行列统计。由于源数据通常包含一些空值甚至空列，会影响数据分析的时间和效率，在预览了数据摘要后，需要对这些无效数据进行处理。

首先调用 DataFrame.isnull() 方法查看数据表中哪些为空值，与它相反的方法是 DataFrame.notnull() ，Pandas会将表中所有数据进行null计算，以True/False作为结果进行填充，如下图所示：

在Python中利用Pandas库处理大数据的简单介绍

Pandas的非空计算速度很快，9800万数据也只需要28.7秒。得到初步信息之后，可以对表中空列进行移除操作。尝试了按列名依次计算获取非空列，和 DataFrame.dropna() 两种方式，时间分别为367.0秒和345.3秒，但检查时发现 dropna() 之后所有的行都没有了，查了Pandas手册，原来不加参数的情况下， dropna() 会移除所有包含空值的行。如果只想移除全部为空值的列，需要加上 axis 和 how 两个参数：

df.dropna(axis=1, how='all')

共移除了14列中的6列，时间也只消耗了85.9秒。

接下来是处理剩余行中的空值，经过测试，在 DataFrame.replace() 中使用空字符串，要比默认的空值NaN节省一些空间；但对整个CSV文件来说，空列只是多存了一个“,”，所以移除的9800万 x 6列也只省下了200M的空间。进一步的数据清洗还是在移除无用数据和合并上。

对数据列的丢弃，除无效值和需求规定之外，一些表自身的冗余列也需要在这个环节清理，比如说表中的流水号是某两个字段拼接、类型描述等，通过对这些数据的丢弃，新的数据文件大小为4.73GB，足足减少了4.04G！

数据处理

使用 DataFrame.dtypes 可以查看每列的数据类型，Pandas默认可以读出int和float64，其它的都处理为object，需要转换格式的一般为日期时间。DataFrame.astype() 方法可对整个DataFrame或某一列进行数据格式转换，支持Python和NumPy的数据类型。

df['Name'] = df['Name'].astype(np.datetime64)

对数据聚合，我测试了 DataFrame.groupby 和 DataFrame.pivot_table 以及 pandas.merge ，groupby 9800万行 x 3列的时间为99秒，连接表为26秒，生成透视表的速度更快，仅需5秒。

df.groupby(['NO','TIME','SVID']).count() # 分组
fullData = pd.merge(df, trancodeData)[['NO','SVID','TIME','CLASS','TYPE']] # 连接
actions = fullData.pivot_table('SVID', columns='TYPE', aggfunc='count') # 透视表

根据透视表生成的交易/查询比例饼图：

在Python中利用Pandas库处理大数据的简单介绍

将日志时间加入透视表并输出每天的交易/查询比例图：

total_actions = fullData.pivot_table('SVID', index='TIME', columns='TYPE', aggfunc='count')
total_actions.plot(subplots=False, figsize=(18,6), kind='area')

在Python中利用Pandas库处理大数据的简单介绍

除此之外，Pandas提供的DataFrame查询统计功能速度表现也非常优秀，7秒以内就可以查询生成所有类型为交易的数据子表：

tranData = fullData[fullData['Type'] == 'Transaction']

该子表的大小为 [10250666 rows x 5 columns]。在此已经完成了数据处理的一些基本场景。实验结果足以说明，在非“>5TB”数据的情况下，Python的表现已经能让擅长使用统计分析语言的数据分析师游刃有余。

在Python中利用Pandas库处理大数据的简单介绍

- Author -

goldensun

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

Python迭代器和生成器介绍

Mar 06 Python

Python MySQLdb Linux下安装笔记

May 09 Python

举例简单讲解Python中的数据存储模块shelve的用法

Mar 03 Python

Python使用tkinter库实现文本显示用户输入功能示例

May 30 Python

Python爬虫将爬取的图片写入world文档的方法

Nov 07 Python

django和vue实现数据交互的方法

Aug 21 Python

Python通过递归获取目录下指定文件代码实例

Nov 07 Python

Python将列表中的元素转化为数字并排序的示例

Dec 25 Python

Tensorflow: 从checkpoint文件中读取tensor方式

Feb 10 Python

python计算Content-MD5并获取文件的Content-MD5值方式

Apr 03 Python

keras 权重保存和权重载入方式

May 21 Python

python查看矩阵的行列号以及维数方式

May 22 Python

详解Python中的join()函数的用法

Apr 07 #Python

Python中用于去除空格的三个函数的使用小结

Apr 07 #Python

简单介绍Python中的len()函数的使用

Apr 07 #Python

Python中endswith()函数的基本使用

Apr 07 #Python

举例详解Python中的split()函数的使用方法

Apr 07 #Python

Python中用startswith()函数判断字符串开头的教程

Apr 07 #Python

把MySQL表结构映射为Python中的对象的教程

Apr 07 #Python

You might like

PHP实现手机归属地查询API接口实现代码

2012/08/27 PHP

处理单名多值表单的详解

2013/06/08 PHP

显示程序执行时间php函数代码

2013/08/29 PHP

叫你如何修改Nginx与PHP的文件上传大小限制

2014/09/10 PHP

网站防止被刷票的一些思路与方法

2015/01/08 PHP

PHPMailer使用QQ邮箱实现邮件发送功能

2017/08/18 PHP

解决laravel5中auth用户登录其他页面获取不到登录信息的问题

2019/10/08 PHP

javascript禁用键盘功能键让右击及其他键无效

2013/10/09 Javascript

浅谈jquery回调函数callback的使用

2015/01/30 Javascript

javaScript事件学习小结（四）event的公共成员（属性和方法）

2016/06/09 Javascript

JavaScript中对象的不同创建方法

2016/08/12 Javascript

使用jquery datatable和bootsrap创建表格实例代码

2017/03/17 Javascript

AngularJS折叠菜单实现方法示例

2017/05/18 Javascript

浅谈实现vue2.0响应式的基本思路

2018/02/13 Javascript

Vue中用props给data赋初始值遇到的问题解决

2018/11/27 Javascript

Node.js中package.json中库的版本号(~和^)

2019/04/02 Javascript

微信小程序使用自定义组件导航实现当前页面高亮

2020/01/02 Javascript

[02:42]完美大师赛主赛事淘汰赛第三日观众采访

2017/11/25 DOTA

深入浅析python 中的匿名函数

2018/05/21 Python

关于pytorch多GPU训练实例与性能对比分析

2019/08/19 Python

sklearn+python:线性回归案例

2020/02/24 Python

python高级特性简介

2020/08/13 Python

PyTorch如何搭建一个简单的网络

2020/08/24 Python

python 还原梯度下降算法实现一维线性回归

2020/10/22 Python

一款利用纯css3实现的win8加载动画的实例分析

2014/12/11 HTML / CSS

美国最大的团购网站：Groupon

2016/07/23 全球购物

Omio波兰：全欧洲低价大巴、火车和航班搜索和比价

2018/02/16 全球购物

Hotels.com越南：酒店预订

2019/10/29 全球购物

安全协议书范本

2014/04/21 职场文书

2014超市双十一活动策划方案

2014/09/29 职场文书

婚宴邀请函

2015/01/30 职场文书

摩登时代观后感

2015/06/03 职场文书

浅谈golang package中init方法的多处定义及运行顺序问题

2021/05/06 Golang

python开发飞机大战游戏

2021/07/15 Python

企业开发CSS命名BEM代码规范实践

2022/02/12 HTML / CSS

索尼ICF-5900W收音机测评

2022/04/24 无线电