collections模块实现了特定目标的容器,以提供Python标准内建容器 dict , list , set , 和 tuple 的替代选择。
包含namedtuple
、deque
、ChainMap
、Counter
、OrderedDict
、defaultdict
等。
本章讲解defaultdict
,基于python3.10。
简介
collections.defaultdict(default_factory=None, /[, ...])
defaultdict
是内置 dict 类的子类。对象包含一个名为default_factory的属性,构造时,第一个参数用于为该属性提供初始值,默认为 None。所有其他参数(包括关键字参数)都相当于传递给 dict 的构造函数。
在字典中获取一个 key 有两种方法, 第一种 get , 第二种 通过 [] 获取,
使用dict时,如果引用的Key不存在,就会抛出KeyError。如果希望key不存在时,返回一个默认值,就可以用defaultdict。
例如:
from collections import defaultdict
d = defaultdict(int)
print(d["a"]) # 0
missing方法
defaultdict 对象除了支持标准 dict 的操作,还有一个很重要的方法:__missing__(key)
。
如果 default_factory 属性为 None,则调用本方法会抛出 KeyError 异常,附带参数 key。
如果 default_factory 不为 None,则它会被(不带参数地)调用来为 key 提供一个默认值,这个值和 key 作为一对键值对被插入到字典中,并作为本方法的返回值返回。
如果调用 default_factory 时抛出了异常,这个异常会原封不动地向外层传递。
在无法找到所需键值时,本方法会被 dict 中的 __getitem__()
方法调用。无论本方法返回了值还是抛出了异常,都会被__getitem__()
传递。
注意:__missing__()
不会 被 __getitem__()
以外的其他方法调用。意味着 get() 会像正常的 dict 那样返回 None,而不是使用 default_factory。
示例
使用 list 作为 default_factory,很轻松地将(键-值对组成的)序列转换为(键-列表组成的)字典:
from collections import defaultdict
s = [('yellow', 1), ('blue', 2), ('yellow', 3), ('blue', 4), ('red', 1)]
d = defaultdict(list)
for k, v in s:
d[k].append(v)
print(d) # defaultdict(<class 'list'>, {'yellow': [1, 3], 'blue': [2, 4], 'red': [1]})
print(sorted(d.items())) # [('blue', [2, 4]), ('red', [1]), ('yellow', [1, 3])]
当每个键第一次遇见时,它还没有在字典里面,所以自动创建该条目,即调用 default_factory 方法,返回一个空的 list。 list.append() 操作添加值到这个新的列表里。当再次存取该键时,就正常操作,list.append() 添加另一个值到列表中。这个计数比它的等价方法 dict.setdefault() 要快速和简单:
s = [('yellow', 1), ('blue', 2), ('yellow', 3), ('blue', 4), ('red', 1)]
d = {}
for k, v in s:
d.setdefault(k, []).append(v)
print(d) # {'yellow': [1, 3], 'blue': [2, 4], 'red': [1]}
print(sorted(d.items())) # [('blue', [2, 4]), ('red', [1]), ('yellow', [1, 3])]
也可以设置 default_factory 为 int,使 defaultdict 用于计数:
from collections import defaultdict
s = 'mississippi'
d = defaultdict(int)
for k in s:
d[k] += 1
sorted(d.items()) # [('i', 4), ('m', 1), ('p', 2), ('s', 4)]
当一个字母首次遇到时,它会查询失败,则 default_factory 会调用 int() 来提供一个整数 0 作为默认值。后续的自增操作建立起对每个字母的计数。
函数 int() 总是返回 0,这是常数函数的特殊情况。一个更快和灵活的方法是使用 lambda 函数,可以提供任何常量值(不只是0):
from collections import defaultdict
d = defaultdict(lambda : '<missing>')
d.update(name='John', action='ran')
print(d) # defaultdict(<function <lambda> at 0x0000021444AD90D0>, {'name': 'John', 'action': 'ran'})
print('%(name)s %(action)s to %(object)s' % d) # John ran to <missing>
还可以设置 default_factory 为 set 使 defaultdict 用于构建 set 集合:
from collections import defaultdict
s = [('red', 1), ('blue', 2), ('red', 3), ('blue', 4), ('red', 1), ('blue', 4)]
d = defaultdict(set)
for k, v in s:
d[k].add(v)
print(d) # defaultdict(<class 'set'>, {'red': {1, 3}, 'blue': {2, 4}})
参考
https://mp.weixin.qq.com/s/RhFynNWU8zCsYJmJO2KpOg