Python数据分析中Groupby用法之通过字典或Series进行分组

在数据分析中有时候需要自己定义分组规则这里简单介绍一下用一个字典实现分组

people=DataFrame(
    np.random.randn(5,5),
    columns=['a','b','c','d','e'],
    index=['Joe','Steve','Wes','Jim','Travis']
)

mapping={'a':'red','b':'red','c':'blue','d':'blue','e':'red','f':'orange'}

by_column=people.groupby(mapping,axis=1)#列方向上进行分组
这里不知道python底层是怎么运行的，最好把运行的结果打印出来看一下
for i in by_column:
    print (i)

遍历的结果：
('blue',   c         d
Joe     0.218189 -0.228336
Steve   1.677264  0.630303
Wes     0.315320 -0.250787
Jim     3.343462  0.483021
Travis  0.854553 -0.760884)
('red',     a         b         e
Joe     0.218164  0.823654 -1.425720
Steve   1.191175 -0.327735  1.926470
Wes    -1.418855  0.497466  0.110105
Jim    -1.157157  0.817122  0.749023
Travis -0.440583 -0.907922  1.374294)

从结果可以看到,把a b e分给了red, c d分给了blue

 a   b   e--->red

 c   d --->blue

接下来再来执行 people.groupby(mapping,axis=1).mean()
            blue       red
Joe     0.241336 -0.182099
Steve   0.459773 -0.448336
Wes     0.205278  0.605721
Jim    -0.094838  1.254174
Travis  0.354140  0.142075
从结果看到在列方向group分组 执行聚合函数mean()后列索引就只有 blue和red了。
整个过程可以这么理解 在列方向上进行分组 a b e为一组为red，c d 为一组为blue。最后以red blue作为新DataFraem的列索引

同样Series也有同样的功能，它可以被看作一个固定大小的映射。对于上面的那个例子，如果用series作为分组键，则pandas会检查Series以确保其索引分组轴是对齐的：
ser=Series(mapping)
a       red
b       red
c      blue
d      blue
e       red
f    orange

by_ser_group=people.groupby(ser,axis=1).mean()
            blue       red
Joe     0.241336 -0.182099
Steve   0.459773 -0.448336
Wes     0.205278  0.605721
Jim    -0.094838  1.254174
Travis  0.354140  0.142075
从结果可以看到，通过字典进行分组和通过Series进行分组结果是相同的。也就是说他们执行的原理是相同的，都是把索引(对series来说)或字典的key与Dataframe的索引进行匹配，
字典中value或series中values值相同的会被分到一个组中，最后根据每组进行在聚合。
groupby的用法很多，之后有时间我会慢慢更新博客。如果有那些地方有错欢迎大家指出，一块学习，共同进步。

Python数据分析中Groupby用法之通过字典或Series进行分组的更多相关文章

Python 数据分析中常用的可视化工具
Python 数据分析中常用的可视化工具 1 Matplotlib 用于创建出版质量图表的绘图工具库,目的是为 Python 构建一个 Matlab 式的绘图接口. 1.1 安装 Anaconada ...
python数据分析中常用的库
Python是数据处理常用工具,可以处理数量级从几K至几T不等的数据,具有较高的开发效率和可维护性,还具有较强的通用性和跨平台性,这里就为大家分享几个不错的数据分析工具,需要的朋友可以参考下 Pyth ...
Python面向对象中super用法与MRO机制
1. 引言最近在研究django rest_framework的源码,老是遇到super,搞得一团蒙,多番查看各路大神博客,总算明白了一点,今天做一点总结. 2. 为什么要用super 1)让代码维 ...
小白学 Python 数据分析（11）：Pandas （十）数据分组
人生苦短,我用 Python 前文传送门: 小白学 Python 数据分析(1):数据分析基础小白学 Python 数据分析(2):Pandas (一)概述小白学 Python 数据分析(3):P ...
Python数据分析中 DataFrame axis=0(0轴)与axis=1(1轴)的理解
python中的axis究竟是如何定义的呢?他们究竟代表是DataFrame的行还是列? 直接上代码people=DataFrame(np.random.randn(5,5), columns=['a ...
Python数据分析中 DataFrame axis=0与axis=1的理解
python中的axis究竟是如何定义的呢?他们究竟代表是DataFrame的行还是列? 直接上代码people=DataFrame(np.random.randn(5,5), columns=['a ...
Python 数据分析中金融数据的来源库和简单操作
目录金融数据 pandas-datareader TuShare 金融学图表案例金融数据数据分析离不开数据的获取,这里介绍几种常用的获取金融方面数据的方法. pandas-datareader ...
Python数据分析中对重复值、缺失值、空格的处理
对重复值的处理把数据结构中,行相同的数据只保留一行函数语法: drop_duplicates() from pandas import read_csv df = read_csv(文件位置) n ...
python class 中__next__用法
class A(): def __init__(self,b): self.b=b # def __iter__(self): # 这个函数可以用,表示迭代标志,但也可以省略 # return sel ...

随机推荐

25、Nginx常见典型故障
1.为什么nginx里面有的是浏览器渲染出的页面,有的时候就变成下载文件? 这个一个取决于服务端nginx,一个取决于你浏览器.在Nginx服务端的配置文件目录下,有一个mime.types 文件,内 ...
web攻击日志分析之新手指南
0x00 前言现实中可能会经常出现web日志当中出现一些被攻击的迹象,比如针对你的一个站点的URL进行SQL注入测试等等,这时候需要你从日志当中分析到底是个什么情况,如果非常严重的话,可能需要调查取 ...
[牛客] [#1108 J] [树形结构] 买一送一
2019牛客国庆集训派对day3 链接:https://ac.nowcoder.com/acm/contest/1108/J来源:牛客网题意 ICPCCamp 有 n 个商店,用 $1,2,..., ...
magento获取当前栏目ID号与栏目名称函数
Magento获取当前栏目ID:$_cat= new Mage_Catalog_Block_Navigation();$curent_cat= $_cat->getCurrentCategory ...
Django学习系列11:在服务器中处理POST请求
之前的代码还没有为表单指定action=属性,因此提交表单默认返回之前渲染的页面,即“/”,这个由视图函数home_page处理.下面修改这个视图函数,让它能处理POST请求. 这意味着要为视图函数h ...
PHP商城的搜索功能
大家好,今天分享一个商城的搜索功能,建立在上一篇文章的基础上实现的. 搜索功能简单的说就是通过sql语句在数据库中实现模糊查找连接数据库,实现分页功能(可以参考上一篇文章) 定义一个变量接收传过来的 ...
K8S概念
1.master master是集群的网关和中枢,负责诸如为用户和客户端暴露api.跟踪其他服务器的健康状态.以最优方式调度工作负载,以及编排其他组件之间的通信等服务,它是用户或客户端与集群之间的核心 ...
python1-集合、函数（全局变量与局部变量）
集合(set) # s=set('hello')# print(s)## s=set(['alex','alex','sb'])# print(s) # s={1,2,3,4,5,6} #添加# s. ...
总结c语言
这个月的总结,我学到的知识虽然不是很多,学的很慢,也不懂什么意思,也没有多加去复习,也许这就是不去敲代码的代价,也只会简单的代码,学的时候真的是找不到思路,觉得这代码跟着老师讲课照着输入进去就可以了, ...
js array map() 函数的简单使用
语法: array.map(function(currentValue,index,arr), thisValue) currentValue:必须.当前元素的值 index:可选.当前元素的索引值 ...

Python数据分析中Groupby用法之通过字典或Series进行分组

Python数据分析中Groupby用法之通过字典或Series进行分组的更多相关文章

随机推荐

热门专题