分享python数据统计的一些小技巧


Posted in Python onJuly 21, 2016

最近在用python做数据统计,这里总结了一些最近使用时查找和总结的一些小技巧,希望能帮助在做这方面时的一些童鞋。有些技巧是很平常的用法,平时我们没有注意,但是在特定场景,这些小方法还是能带来很大的帮助。

1.在字典中将键映射到多个值上面

{'b': [4, 5, 6], 
'a': [1, 2, 3]}

有时候我们在统计相同key值的时候,希望把所有相同key的条目添加到以key为键的一个字典中,然后再进行各种操作,这时候我们就可以使用下面的代码进行操作:

from collections import defaultdict
d = defaultdict(list)
print(d)
d['a'].append(1)
d['a'].append(2)
d['a'].append(3)
d['b'].append(4)
d['b'].append(5)
d['b'].append(6)
print(d)
print(d.get("a"))
print(d.keys())
print([d.get(i) for i in d])

这里是使用了collections中的方法,这里面还拥有很多有用的方法,我们有时间在继续进行深入了解。

上面代码运行结果:

defaultdict(, {})
defaultdict(, {'b': [4, 5, 6], 'a': [1, 2, 3]})
[1, 2, 3]
dict_keys(['b', 'a'])
[[4, 5, 6], [1, 2, 3]]

我们将数据填入之后,相当于进行快速分组,然后遍历每个组就可以统计一些我们需要的数据。

2.迅速转换字典键值对

data = {...}
zip(data.values(), data.keys())

data是我们的格式数据,使用zip后进行快速键值转换,然后可以使用max,min之类函数进行数据操作。

3.通过公共键对字典进行排序

from operator import itemgetter
data = [
  {'name': "bran", "uid": 101},
  {'name': "xisi", "uid": 102},
  {'name': "land", "uid": 103}
]
print(sorted(data, key=itemgetter("name")))
print(sorted(data, key=itemgetter("uid")))

数据格式就是data,我们想要对name或者uid进行排序我们就是用代码中的方法。
运行结果:

[{'name': 'bran', 'uid': 101}, {'name': 'land', 'uid': 103}, {'name': 'xisi', 'uid': 102}]
[{'name': 'bran', 'uid': 101}, {'name': 'xisi', 'uid': 102}, {'name': 'land', 'uid': 103}]

正如我们期望中的一样

4.对列表中的多个字典根据某一字段进行分组

注意注意,在进行分组前要首先对数据进行排序处理,排序字段根据实际要求来选择

即将处理的数据:

rows = [
  {'name': "bran", "uid": 101, "class": 13},
  {'name': "xisi", "uid": 101, "class": 11},
  {'name': "land", "uid": 103, "class": 10}
]

期望处理结果:

{
101: [{'name': 'xisi', 'class': 11, 'uid': 101},{'name': 'bran', 'class': 13, 'uid': 101}],
103: [{'name': 'land', 'class': 10, 'uid': 103}]
}

我们按照uid进行分组,这里只是演示,uid一般也不会重复。

这个比较复杂一点,我们一部一步来分解

some = [('a', [1, 2, 3]), ('b', [4, 5, 6])]
print(dict(some))

结果:

{'b': [4, 5, 6], 'a': [1, 2, 3]}

这里我们的目的是将元组转换成字典,这个很简单,应该都能看懂。接着我们来下一步对待处理数据进行排序:

data_one = sorted(rows, key=itemgetter("class"))
print(data_one)
data_two = sorted(rows, key=lambda x: (x["uid"], x["class"]))
print(data_two)

这里我们提供两种排序方式原理相同,只是样式稍有区别,第一种data_one是直接使用itemgetter,按照我们前面使用过得,直接按照某一字段进行排序,可是有时候我们会有另一种要求:

先按照某一字段排序,当第一字段重复时,再按照另一字段排序。

这时我们就用第二种方法,进行多字段值排序。
排序结果如下:

[{'name': 'land', 'class': 10, 'uid': 103}, {'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}]
[{'name': 'xisi', 'class': 11, 'uid': 101}, {'name': 'bran', 'class': 13, 'uid': 101}, {'name': 'land', 'class': 10, 'uid': 103}]

结果大家慢慢看一下,还是略有差别。

接下来就进行最后一步了,将我们刚才讲的两种方式结合起来使用:

data = dict([(g, list(k)) for g, k in groupby(data_two, key=lambda x: x["uid"])])
print(data)

我们对排序好的数据进行分组,然后生成元组列表,最后将其转换成字典,这里大功告成,我们成功将数据进行分组。

python数据统计的一些小技巧就分享到这,有需要的可以参考学习。

Python 相关文章推荐
Python编程求解二叉树中和为某一值的路径代码示例
Jan 04 Python
详细解读tornado协程(coroutine)原理
Jan 15 Python
聊聊python里如何用Borg pattern实现的单例模式
Jun 06 Python
Pyqt5 基本界面组件之inputDialog的使用
Jun 25 Python
详解Django-channels 实现WebSocket实例
Aug 22 Python
Python提取PDF内容的方法(文本、图像、线条等)
Sep 25 Python
Python利用PyExecJS库执行JS函数的案例分析
Dec 18 Python
python通过移动端访问查看电脑界面
Jan 06 Python
python修改linux中文件(文件夹)的权限属性操作
Mar 05 Python
python读取mysql数据绘制条形图
Mar 25 Python
详解anaconda安装步骤
Nov 23 Python
python 中[0]*2与0*2的区别说明
May 10 Python
python中print的不换行即时输出的快速解决方法
Jul 20 #Python
Python全局变量用法实例分析
Jul 19 #Python
python对象及面向对象技术详解
Jul 19 #Python
python异常和文件处理机制详解
Jul 19 #Python
python线程、进程和协程详解
Jul 19 #Python
浅谈python字符串方法的简单使用
Jul 18 #Python
python读取oracle函数返回值
Jul 18 #Python
You might like
用PHP实现WEB动态网页静态
2006/10/09 PHP
php面向对象全攻略 (十五) 多态的应用
2009/09/30 PHP
Joomla开启SEF的方法
2016/05/04 PHP
php遍历解析xml字符串的方法
2016/05/05 PHP
PHP区块查询实现方法分析
2018/05/12 PHP
PHP实现的服务器一致性hash分布算法示例
2018/08/09 PHP
动态刷新 dorado树的js代码
2009/06/12 Javascript
jquery 实现checkbox全选,反选,全不选等功能代码(奇数)
2012/10/24 Javascript
js实现类似于add(1)(2)(3)调用方式的方法
2015/03/04 Javascript
jQuery实现自动滚动到页面顶端的方法
2015/05/22 Javascript
Node.js的Express框架使用上手指南
2016/03/12 Javascript
javaScript数组迭代方法详解
2016/04/14 Javascript
在web中js实现类似excel的表格控件
2016/09/01 Javascript
js利用appendChild对标签进行排序的实现方法
2016/10/16 Javascript
基于vue 实现token验证的实例代码
2017/12/14 Javascript
Vue传参一箩筐(页面、组件)
2019/04/04 Javascript
[02:53]DOTA2英雄昆卡基础教程
2013/11/25 DOTA
50行代码实现贪吃蛇(具体思路及代码)
2013/04/27 Python
Python实现保证只能运行一个脚本实例
2015/06/24 Python
Python的Django框架下管理站点的基本方法
2015/07/17 Python
实例解析Python中的__new__特殊方法
2016/06/02 Python
深入分析python数据挖掘 Json结构分析
2018/04/21 Python
使用Python向C语言的链接库传递数组、结构体、指针类型的数据
2019/01/29 Python
Python实现平行坐标图的两种方法小结
2019/07/04 Python
美国最受欢迎的童装品牌之一:The Children’s Place
2016/07/23 全球购物
男女时尚与复古风格在线购物:RoseGal(全球免费送货)
2017/07/19 全球购物
银河香水:Galaxy Perfume
2019/03/25 全球购物
Foot Locker澳洲官网:美国运动服和鞋类零售商
2019/10/11 全球购物
机械设计制造专业个人求职信
2013/09/25 职场文书
上班上网检讨书
2014/01/29 职场文书
大学生军训自我鉴定
2014/02/12 职场文书
优秀驾驶员先进事迹材料
2014/05/04 职场文书
2014法院干警廉洁警示教育思想汇报
2014/09/13 职场文书
2014年教学管理工作总结
2014/12/02 职场文书
MySQL中int (10) 和 int (11) 的区别
2022/01/22 MySQL
python超详细实现完整学生成绩管理系统
2022/03/17 Python