论文作者统计(pandas字符串操作)
github
涉及知识点如下:
1、data[‘categories’].apply(lambda x: ‘cs.CV’ in x)结果理解
2、sum函数的嵌套列表元素合并
3、dataframe和series中value_counts函数的使用
代码如下:
# 导入所需的package
import json #读取数据,我们的数据为json格式的
import pandas as pd #数据处理,数据分析
import matplotlib.pyplot as plt #画图工具
# 选择类别为cs.CV下面的论文
data2 = data[data['categories'].apply(lambda x: 'cs.CV' in x)]
# 拼接所有作者
all_authors = sum(data2['authors_parsed'