分享python数据统计的一些小技巧


Posted in Python onJuly 21, 2016

最近在用python做数据统计,这里总结了一些最近使用时查找和总结的一些小技巧,希望能帮助在做这方面时的一些童鞋。有些技巧是很平常的用法,平时我们没有注意,但是在特定场景,这些小方法还是能带来很大的帮助。

1.在字典中将键映射到多个值上面

{'b': [4, 5, 6], 
'a': [1, 2, 3]}

有时候我们在统计相同key值的时候,希望把所有相同key的条目添加到以key为键的一个字典中,然后再进行各种操作,这时候我们就可以使用下面的代码进行操作:

from collections import defaultdict
d = defaultdict(list)
print(d)
d['a'].append(1)
d['a'].append(2)
d['a'].append(3)
d['b'].append(4)
d['b'].append(5)
d['b'].append(6)
print(d)
print(d.get("a"))
print(d.keys())
print([d.get(i) for i in d])

这里是使用了collections中的方法,这里面还拥有很多有用的方法,我们有时间在继续进行深入了解。

上面代码运行结果:

defaultdict(, {})
defaultdict(, {'b': [4, 5, 6], 'a': [1, 2, 3]})
[1, 2, 3]
dict_keys(['b', 'a'])
[[4, 5, 6], [1, 2, 3]]

我们将数据填入之后,相当于进行快速分组,然后遍历每个组就可以统计一些我们需要的数据。

2.迅速转换字典键值对

data = {...}
zip(data.values(), data.keys())

data是我们的格式数据,使用zip后进行快速键值转换,然后可以使用max,min之类函数进行数据操作。

3.通过公共键对字典进行排序

from operator import itemgetter
data = [
  {'name': "bran", "uid": 101},
  {'name': "xisi", "uid": 102},
  {'name': "land", "uid": 103}
]
print(sorted(data, key=itemgetter("name")))
print(sorted(data, key=itemgetter("uid")))

数据格式就是data,我们想要对name或者uid进行排序我们就是用代码中的方法。
运行结果:

[{'name': 'bran', 'uid': 101}, {'name': 'land', 'uid': 103}, {'name': 'xisi', 'uid': 102}]
[{'name': 'bran', 'uid': 101}, {'name': 'xisi', 'uid': 102}, {'name': 'land', 'uid': 103}]

正如我们期望中的一样

4.对列表中的多个字典根据某一字段进行分组

注意注意,在进行分组前要首先对数据进行排序处理,排序字段根据实际要求来选择

即将处理的数据:

rows = [
  {'name': "bran", "uid": 101, "class": 13},
  {'name': "xisi", "uid": 101, "class": 11},
  {'name': "land", "uid": 103, "class": 10}
]

期望处理结果:

{
101: [{'name': 'xisi', 'class': 11, 'uid': 101},{'name': 'bran', 'class': 13, 'uid': 101}],
103: [{'name': 'land', 'class': 10, 'uid': 103}]
}

我们按照uid进行分组,这里只是演示,uid一般也不会重复。

这个比较复杂一点,我们一部一步来分解

some = [('a', [1, 2, 3]), ('b', [4, 5, 6])]
print(dict(some))

结果:

{'b': [4, 5, 6], 'a': [1, 2, 3]}

这里我们的目的是将元组转换成字典,这个很简单,应该都能看懂。接着我们来下一步对待处理数据进行排序:

data_one = sorted(rows, key=itemgetter("class"))
print(data_one)
data_two = sorted(rows, key=lambda x: (x["uid"], x["class"]))
print(data_two)

这里我们提供两种排序方式原理相同,只是样式稍有区别,第一种data_one是直接使用itemgetter,按照我们前面使用过得,直接按照某一字段进行排序,可是有时候我们会有另一种要求:

先按照某一字段排序,当第一字段重复时,再按照另一字段排序。

这时我们就用第二种方法,进行多字段值排序。
排序结果如下:

[{'name': 'land', 'class': 10, 'uid': 103}, {'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}]
[{'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}, {'name': 'land', 'class': 10, 'uid': 103}]

结果大家慢慢看一下,还是略有差别。

接下来就进行最后一步了,将我们刚才讲的两种方式结合起来使用:

data = dict([(g, list(k)) for g, k in groupby(data_two, key=lambda x: x["uid"])])
print(data)

我们对排序好的数据进行分组,然后生成元组列表,最后将其转换成字典,这里大功告成,我们成功将数据进行分组。

python数据统计的一些小技巧就分享到这,有需要的可以参考学习。

Python 相关文章推荐
Python 3.x 连接数据库示例(pymysql 方式)
Jan 19 Python
pygame实现弹力球及其变速效果
Jul 03 Python
浅析Python中return和finally共同挖的坑
Aug 18 Python
python线程池threadpool使用篇
Apr 27 Python
对python抓取需要登录网站数据的方法详解
May 21 Python
python一键去抖音视频水印工具
Sep 14 Python
Python中的 sort 和 sorted的用法与区别
Aug 10 Python
利用python在大量数据文件下删除某一行的例子
Aug 21 Python
小 200 行 Python 代码制作一个换脸程序
May 12 Python
Python代码执行时间测量模块timeit用法解析
Jul 01 Python
flask开启多线程的具体方法
Aug 02 Python
Python使用cn2an实现中文数字与阿拉伯数字的相互转换
Mar 02 Python
python中print的不换行即时输出的快速解决方法
Jul 20 #Python
Python全局变量用法实例分析
Jul 19 #Python
python对象及面向对象技术详解
Jul 19 #Python
python异常和文件处理机制详解
Jul 19 #Python
python线程、进程和协程详解
Jul 19 #Python
浅谈python字符串方法的简单使用
Jul 18 #Python
python读取oracle函数返回值
Jul 18 #Python
You might like
一个PHP日历程序
2006/12/06 PHP
MySQL连接数超过限制的解决方法
2011/07/17 PHP
配置eAccelerator和XCache扩展来加速PHP程序的执行
2015/12/22 PHP
PHP使用Redis替代文件存储Session的方法
2017/02/15 PHP
修复ie8&chrome下window的resize事件多次执行
2011/10/20 Javascript
jBox 2.3基于jquery的最新多功能对话框插件 常见使用问题解答
2011/11/10 Javascript
jQuery仿Excel表格编辑功能的实现代码
2013/05/01 Javascript
ExtJS4中使用mixins实现多继承示例
2013/12/03 Javascript
JS如何判断是否为ie浏览器的方法(包括IE10、IE11在内)
2015/12/13 Javascript
javascript函数命名的三种方式及区别介绍
2016/03/22 Javascript
JS随机洗牌算法之数组随机排序
2016/03/23 Javascript
Javascript对象字面量的理解
2016/06/22 Javascript
AngularJS ng-bind 指令简单实现
2016/07/30 Javascript
javascript使用 concat 方法对数组进行合并的方法
2016/09/08 Javascript
bootstrap组件之按钮式下拉菜单小结
2017/01/19 Javascript
bootstrap输入框组件使用方法详解
2017/01/19 Javascript
jQuery实现优雅的弹窗效果(6)
2017/02/08 Javascript
nodejs和C语言插入mysql数据库乱码问题的解决方法
2017/04/14 NodeJs
深入理解Vue transition源码分析
2017/07/30 Javascript
vue插件vue-resource的使用笔记(小结)
2017/08/04 Javascript
vue实现验证码按钮倒计时功能
2018/04/10 Javascript
vue-auto-focus: 控制自动聚焦行为的 vue 指令方法
2018/08/25 Javascript
vue项目中使用Svg的方法
2018/10/24 Javascript
[09:43]DOTA2每周TOP10 精彩击杀集锦vol.5
2014/06/25 DOTA
python打印9宫格、25宫格等奇数格 满足横竖斜相加和相等
2019/07/19 Python
Python使用指定端口进行http请求的例子
2019/07/25 Python
Python-jenkins 获取job构建信息方式
2020/05/12 Python
python爬虫爬取淘宝商品比价(附淘宝反爬虫机制解决小办法)
2020/12/03 Python
幼儿园中班下学期评语
2014/04/18 职场文书
2014年教师节活动总结
2014/08/29 职场文书
教师党的群众路线教育实践活动个人整改措施
2014/11/04 职场文书
放弃遗产继承公证书
2015/01/26 职场文书
庆六一开幕词
2015/01/29 职场文书
一文搞懂如何实现Go 超时控制
2021/03/30 Python
探讨Java中的深浅拷贝问题
2021/06/26 Java/Android
mysql 直接拷贝data 目录下文件还原数据的实现
2021/07/25 MySQL