一文详解Python如何优雅地对数据进行分组

更新时间：2022年07月14日 10:18:26 作者：Python技术大本营

这篇文章主要和大家详细介绍一下Python是如何优雅地对数据进行分组的，文中通过示例进行了详细的讲解，感兴趣的小伙伴可以跟随小编一起学习一下

假设我们有这样一种数据：

data = [
    ("apple", 30), ("apple", 35),
    ("apple", 32), ("pear", 60),
    ("pear", 32), ("pear", 60),
    ("banana", 102), ("banana", 104)
]

# 我们希望变成如下格式
"""
[('apple', [30, 35, 32]), 
 ('pear', [60, 32, 60]), 
 ('banana', [102, 104])]
"""

如果是你的话，你会怎么做呢？很容易想到的一种解决方案是构造一个字典：

data = [
    ("apple", 30), ("apple", 35),
    ("apple", 32), ("pear", 60),
    ("pear", 32), ("pear", 60),
    ("banana", 102), ("banana", 104)
]

data_dict = {}
for name, count in data:
    if name not in data_dict:
        data_dict[name] = []
    data_dict[name].append(count)
print(data_dict)
"""
{'apple': [30, 35, 32], 
 'pear': [60, 32, 60], 
 'banana': [102, 104]}
"""
print(list(data_dict.items()))
"""
[('apple', [30, 35, 32]), 
 ('pear', [60, 32, 60]), 
 ('banana', [102, 104])]
"""

这种方案完全没有问题，不过我们还可以写的更优雅一些，也就是使用字典的 setdefault 方法：

data = [
    ("apple", 30), ("apple", 35),
    ("apple", 32), ("pear", 60),
    ("pear", 32), ("pear", 60),
    ("banana", 102), ("banana", 104)
]

data_dict = {}
for name, count in data:
    # setdefault(k, v) 含义如下
    # 当 k 不存在时，将 k: v 设置在字典中，并返回 v
    # 当 k 存在时，直接返回 k 对应值
    data_dict.setdefault(name, []).append(count)

print(list(data_dict.items()))
"""
[('apple', [30, 35, 32]), 
 ('pear', [60, 32, 60]), 
 ('banana', [102, 104])]
"""

setdefault 是一个非常方便的方法，但是使用频率却不怎么高，或者说该方法不太让人喜欢。主要是每次调用都要给一个初始值，比如代码中的空列表 []。另外这里的初始值可以任意，如果你希望添加的时候还能实现去重效果，那么就将空列表换成空集合即可。

或者我们还可以使用 defaultdict，它位于 collections 模块中。

from collections import defaultdict

data = [
    ("apple", 30), ("apple", 35),
    ("apple", 32), ("pear", 60),
    ("pear", 32), ("pear", 60),
    ("banana", 102), ("banana", 104)
]

# 里面接收一个 callable
# 当访问的 k 不存在时，返回 callable 调用之后的值
data_dict1 = defaultdict(list)
for name, count in data:
    data_dict1[name].append(count)

print(list(data_dict1.items()))
"""
[('apple', [30, 35, 32]), 
 ('pear', [60, 32, 60]), 
 ('banana', [102, 104])]
"""

# 也可以指定为 set
data_dict2 = defaultdict(set)
for name, count in data:
    data_dict2[name].add(count)

print(list(data_dict2.items()))
"""
[('apple', {32, 35, 30}), 
 ('pear', {32, 60}), 
 ('banana', {104, 102})]
"""

总的来说，defaultdict 和字典的 setdefault 方法非常类似，我们使用 setdefault 即可。

当然啦，关于分组，还有一种特殊情况，就是词频统计。假设我们想统计可迭代对象中，每个元素出现的次数该怎么做呢？

data = ["apple", "apple", "apple",
        "pear", "pear", "pear",
        "banana", "banana"]

data_dict = {}
for item in data:
    # 此处不能使用 setdefault，因为它是函数
    # .setdefault(item, 0) += 1 是不符合语法规则的
    if item not in data_dict:
        data_dict[item] = 0
    data_dict[item] += 1

print(data_dict)
"""
{'apple': 3, 'pear': 3, 'banana': 2}
"""

# 或者使用 defaultdict
from collections import defaultdict
data_dict = defaultdict(int)
for item in data:
    data_dict[item] += 1
print(data_dict)
"""
defaultdict(<class 'int'>, 
            {'apple': 3, 'pear': 3, 'banana': 2})
"""

然而说到词频统计，我们还可以使用 collections 下的 Counter 类。

from collections import Counter

data = ["apple", "apple", "apple",
        "pear", "pear", "pear",
        "banana", "banana"]

data_dict = Counter(data)
# 直接搞定，Counter 已经包含了我们之前的逻辑
print(data_dict)
"""
Counter({'apple': 3, 'pear': 3, 'banana': 2})
"""
# Counter 继承 dict，除了支持字典操作之外
# 还提供了很多其它操作，其中一个就是 most_common
# 用于选择出现频率最高的几个元素
print(data_dict.most_common(2))
"""
[('apple', 3), ('pear', 3)]
"""

还是很简单的。

到此这篇关于一文详解Python如何优雅地对数据进行分组的文章就介绍到这了,更多相关Python数据分组内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

Python进制转换用法详解
大家好，本篇文章主要讲的是Python进制转换用法详解，感兴趣的同学赶快来看一看吧，对你有帮助的话记得收藏一下
2022-01-01
Python cookbook（数据结构与算法）实现优先级队列的方法示例
这篇文章主要介绍了Python cookbook（数据结构与算法）实现优先级队列的方法,结合实例形式分析了Python中基于给定优先级进行队列元素排序的相关操作技巧,需要的朋友可以参考下
2018-02-02
python神经网络Densenet模型复现详解
这篇文章主要为大家介绍了python神经网络Densenet模型复现详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
2022-05-05
对python中的高效迭代器函数详解
今天小编就为大家分享一篇对python中的高效迭代器函数详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2018-10-10
python实现给字典添加条目的方法
这篇文章主要介绍了python实现给字典添加条目的方法,是比较实用的字典操作技巧,实例备有简单的注释,需要的朋友可以参考下
2014-09-09
微信跳一跳自动运行python脚本
这篇文章主要为大家详细介绍了微信小程序跳一跳自动运行脚本，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2018-01-01
python基于socket实现的UDP及TCP通讯功能示例
这篇文章主要介绍了python基于socket实现的UDP及TCP通讯功能,结合实例形式分析了基于Python socket模块的UDP及TCP通信相关客户端、服务器端实现技巧,需要的朋友可以参考下
2019-11-11
Python 定义只读属性的实现方式
这篇文章主要介绍了Python 定义只读属性的实现方式，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-03-03
python+flask实现API的方法
这篇文章主要为大家详细介绍了python+flask实现API的方法，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2018-11-11
Python 敏感词过滤的实现示例
本文主要介绍了Python 敏感词过滤的实现示例，文中通过示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2021-08-08