编程 Python

使用Python Pandas处理亿级数据的方法

Posted in Python onJune 24, 2019

在数据分析领域，最热门的莫过于Python和R语言，此前有一篇文章《别老扯什么Hadoop了，你的数据根本不够大》指出：只有在超过5TB数据量的规模下，Hadoop才是一个合理的技术选择。这次拿到近亿条日志数据，千万级数据已经是关系型数据库的查询分析瓶颈，之前使用过Hadoop对大量文本进行分类，这次决定采用Python来处理数据：

硬件环境

CPU：3.5 GHz Intel Core i7
内存：32 GB HDDR 3 1600 MHz
硬盘：3 TB Fusion Drive

数据分析工具

Python：2.7.6
Pandas：0.15.0
IPython notebook：2.0.0

源数据如下表所示：

	Table	Size	Desc
ServiceLogs	98,706,832 rows x 14 columns	8.77 GB	交易日志数据，每个交易会话可以有多条交易
ServiceCodes	286 rows × 8 columns	20 KB	交易分类的字典表

数据读取

启动IPython notebook，加载pylab环境：

ipython notebook --pylab=inline

Pandas提供了IO工具可以将大文件分块读取，测试了一下性能，完整加载9800万条数据也只需要263秒左右，还是相当不错了。

import pandas as pd
reader = pd.read_csv('data/servicelogs', iterator=True)
try:
  df = reader.get_chunk(100000000)
except StopIteration:
  print "Iteration is stopped."

	1百万条	1千万条	1亿条
ServiceLogs	1 s	17 s	263 s

使用不同分块大小来读取再调用pandas.concat连接DataFrame，chunkSize设置在1000万条左右速度优化比较明显。

loop = True
chunkSize = 100000
chunks = []
while loop:
  try:
    chunk = reader.get_chunk(chunkSize)
    chunks.append(chunk)
  except StopIteration:
    loop = False
    print "Iteration is stopped."
df = pd.concat(chunks, ignore_index=True)

下面是统计数据，Read Time是数据读取时间，Total Time是读取和Pandas进行concat操作的时间，根据数据总量来看，对5~50个DataFrame对象进行合并，性能表现比较好。

Chunk Size Read Time (s) Total Time (s) Performance100,000224.418173261.358521200,000232.076794256.6741541,000,000213.128481234.934142√√2,000,000208.410618230.006299√√√5,000,000209.460829230.939319√√√10,000,000207.082081228.135672√√√√20,000,000209.628596230.775713√√√50,000,000222.910643242.405967100,000,000263.574246263.574246

使用Python Pandas处理亿级数据的方法

如果使用Spark提供的Python Shell，同样编写Pandas加载数据，时间会短25秒左右，看来Spark对Python的内存使用都有优化。

数据清洗

Pandas提供了DataFrame.describe方法查看数据摘要，包括数据查看（默认共输出首尾60行数据）和行列统计。由于源数据通常包含一些空值甚至空列，会影响数据分析的时间和效率，在预览了数据摘要后，需要对这些无效数据进行处理。

首先调用DataFrame.isnull()方法查看数据表中哪些为空值，与它相反的方法是DataFrame.notnull()，Pandas会将表中所有数据进行null计算，以True/False作为结果进行填充，如下图所示：

使用Python Pandas处理亿级数据的方法

Pandas的非空计算速度很快，9800万数据也只需要28.7秒。得到初步信息之后，可以对表中空列进行移除操作。尝试了按列名依次计算获取非空列，和DataFrame.dropna()两种方式，时间分别为367.0秒和345.3秒，但检查时发现 dropna() 之后所有的行都没有了，查了Pandas手册，原来不加参数的情况下， dropna() 会移除所有包含空值的行。如果只想移除全部为空值的列，需要加上 axis 和 how 两个参数：

df.dropna(axis=1, how='all')

共移除了14列中的6列，时间也只消耗了85.9秒。

接下来是处理剩余行中的空值，经过测试，在DataFrame.replace()中使用空字符串，要比默认的空值NaN节省一些空间；但对整个CSV文件来说，空列只是多存了一个“,”，所以移除的9800万 x 6列也只省下了200M的空间。进一步的数据清洗还是在移除无用数据和合并上。

对数据列的丢弃，除无效值和需求规定之外，一些表自身的冗余列也需要在这个环节清理，比如说表中的流水号是某两个字段拼接、类型描述等，通过对这些数据的丢弃，新的数据文件大小为4.73GB，足足减少了4.04G！

数据处理

使用DataFrame.dtypes可以查看每列的数据类型，Pandas默认可以读出int和float64，其它的都处理为object，需要转换格式的一般为日期时间。DataFrame.astype()方法可对整个DataFrame或某一列进行数据格式转换，支持Python和NumPy的数据类型。

df['Name'] = df['Name'].astype(np.datetime64)

对数据聚合，我测试了 DataFrame.groupby 和 DataFrame.pivot_table 以及 pandas.merge ，groupby 9800万行 x 3列的时间为99秒，连接表为26秒，生成透视表的速度更快，仅需5秒。

df.groupby(['NO','TIME','SVID']).count() # 分组
fullData = pd.merge(df, trancodeData)[['NO','SVID','TIME','CLASS','TYPE']] # 连接
actions = fullData.pivot_table('SVID', columns='TYPE', aggfunc='count') # 透视表

根据透视表生成的交易/查询比例饼图：

使用Python Pandas处理亿级数据的方法

将日志时间加入透视表并输出每天的交易/查询比例图：

total_actions = fullData.pivot_table('SVID', index='TIME', columns='TYPE', aggfunc='count')
total_actions.plot(subplots=False, figsize=(18,6), kind='area')

使用Python Pandas处理亿级数据的方法

除此之外，Pandas提供的DataFrame查询统计功能速度表现也非常优秀，7秒以内就可以查询生成所有类型为交易的数据子表：

tranData = fullData[fullData['Type'] == 'Transaction']

该子表的大小为[10250666 rows x 5 columns]。在此已经完成了数据处理的一些基本场景。实验结果足以说明，在非“>5TB”数据的情况下，Python的表现已经能让擅长使用统计分析语言的数据分析师游刃有余。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持三水点靠木。

使用Python Pandas处理亿级数据的方法

- Author -

frchen

声明：登载此文出于传递更多信息之目的，并不意味着赞同其观点或证实其描述。

Python 相关文章推荐

python构造icmp echo请求和实现网络探测器功能代码分享

Jan 10 Python

Python中的模块和包概念介绍

Apr 13 Python

在Django的URLconf中使用多个视图前缀的方法

Jul 18 Python

详谈Python2.6和Python3.0中对除法操作的异同

Apr 28 Python

Python实现字典的遍历与排序功能示例

Dec 23 Python

对python中的xlsxwriter库简单分析

May 04 Python

python可视化实现代码

Jan 15 Python

python实现矩阵和array数组之间的转换

Nov 29 Python

Python tkinter模版代码实例

Feb 05 Python

PyQt5如何将.ui文件转换为.py文件的实例代码

May 26 Python

在Python3.74+PyCharm2020.1 x64中安装使用Kivy的详细教程

Aug 07 Python

用python对excel进行操作(读,写,修改)

Dec 25 Python

Python3批量生成带logo的二维码方法

Jun 24 #Python

解决python文件双击运行秒退的问题

Jun 24 #Python

对python中的控制条件、循环和跳出详解

Jun 24 #Python

django框架自定义模板标签(template tag)操作示例

Jun 24 #Python

解决Python内层for循环如何break出外层的循环的问题

Jun 24 #Python

Python 循环终止语句的三种方法小结

Jun 24 #Python

12个Python程序员面试必备问题与答案(小结)

Jun 24 #Python

You might like

Views rows style模板重写代码

2011/05/16 PHP

一个比较不错的PHP日历类分享

2014/11/18 PHP

利用PHP命令行模式采集股票趋势信息

2016/08/09 PHP

php版微信公众号接口实现发红包的方法

2016/10/14 PHP

laravel框架模板之公共模板、继承、包含实现方法分析

2019/08/30 PHP

PHP中echo与print区别点整理

2021/03/09 PHP

javascript中match函数的用法小结

2014/02/08 Javascript

JS 实现列表与多选框选择附预览动画

2014/10/29 Javascript

Javascript基础教程之argument 详解

2015/01/18 Javascript

Bootstrap导航栏各元素操作方法(表单、按钮、文本)

2015/12/28 Javascript

js实现input密码框提示信息的方法(附html5实现方法)

2016/01/14 Javascript

jquery获取form表单input元素值的简单实例

2016/05/30 Javascript

webpack常用配置项配置文件介绍

2016/11/07 Javascript

webpack优化的深入理解

2018/12/10 Javascript

JavaScript实现页面中录音功能的方法

2019/06/04 Javascript

layui表格内放置图片,并点击放大的实例

2019/09/10 Javascript

js回调函数原理与用法案例分析

2020/03/04 Javascript

[01:00:25]2018DOTA2亚洲邀请赛3月30日小组赛A组 VG VS Liquid

2018/03/31 DOTA

Python3.6.0+opencv3.3.0人脸检测示例

2018/05/25 Python

基于python实现聊天室程序

2018/07/27 Python

Python常见读写文件操作实例总结【文本、json、csv、pdf等】

2019/04/15 Python

python3在同一行内输入n个数并用列表保存的例子

2019/07/20 Python

python实现输出一个序列的所有子序列示例

2019/11/18 Python

django中的数据库迁移的实现

2020/03/16 Python

Python+MySQL随机试卷及答案生成程序的示例代码

2021/02/01 Python

python 获取域名到期时间的方法步骤

2021/02/10 Python

HTML5去掉输入框type为number时的上下箭头的实现方法

2020/01/03 HTML / CSS

骆驼官方商城：CAMEL

2016/11/22 全球购物

什么是＂引用＂？申明和使用＂引用＂要注意哪些问题？

2016/03/03 面试题

ORACLE第二个十问

2013/12/14 面试题

大学生村官事迹材料

2014/01/21 职场文书

优化经济发展环境工作总结

2015/08/11 职场文书

详解Java实现数据结构之并查集

2021/06/23 Java/Android

SpringBoot+VUE实现数据表格的实战

2021/08/02 Java/Android

SpringBoot详解执行过程

2022/07/15 Java/Android

MySQL中LAG()函数和LEAD()函数的使用

2022/08/14 MySQL