Datawhale数据分析之学术前沿分析学习笔记（三）

最新推荐文章于 2024-07-30 17:23:09 发布

二品芝麻狐

最新推荐文章于 2024-07-30 17:23:09 发布

阅读量141

点赞数

文章标签：数据分析可视化 python

本文链接：https://blog.csdn.net/udeme625/article/details/112863471

版权

Task3:论⽂代码统计

一、任务说明
二、使用步骤
总结

一、任务说明

论⽂代码统计，统计所有论⽂出现代码的相关统计。

二、使用步骤

1.引入库

import  json
import re
import matplotlib.pyplot as plt
import pandas as pd
import numpy as np

2.读入数据

代码如下（示例）：

data = []

with open('arxiv-metadata-oai-snapshot.json','r') as f:
    for idx,line in enumerate(f):
        if idx >= 50000:
            break
        d = json.loads(line)
        d = {'abstract':d['abstract'],'categories':d['categories'],'comments':d['comments']}
        data.append(d)
data = pd.DataFrame(data)

3.数据预处理

运用正则化

data['page'] = data['comments'].apply(lambda x : re.findall('\d+ pages',str(x)))
#print(data.head())

data = data[data['page'].apply(len)>0]
#print(data['page'].head())
#print(data.head())
data['page_num'] = data['page'].apply(lambda x : re.findall('\d+',str(x)))
print(data.head())
data['page_num2'] = data['page_num'].apply(lambda x : float(x[0]))
print(data.head())

# data['page_num'] = data['page'].apply(lambda x: float(x[0].replace(' pages',
# '')))
# print(data['page_num'].head())
print(data['page_num2'].describe().astype(int))

# 选择主要类别的论文
data['categories'] = data['categories'].apply(lambda x : x.split(' ')[0])
data['categories'] = data['categories'].apply(lambda x : x.split('.')[0])
print(data['categories'][0:5])

4.图表展示

4.1 统计各类别论文的平均数

plt.figure(figsize=(12,6))


# 方案一
data_new = data.groupby(['categories'])['page_num2'].mean()
print(data_new.head())
plt.bar(data_new.index,data_new.values)
plt.xticks(rotation=90)
# 方案二
#data.groupby(['categories'])['page_num2'].mean().plot(kind='bar')

#方案三
# data_new = data.groupby(['categories'])['page_num2'].mean().tolist()
# data_new2 = list(data.groupby(['categories'])['page_num2'].mean().index)

# plt.bar(data_new2,data_new)
# plt.xticks(rotation=90)
plt.show()

图表展示如下：
主要类别论文数

总结

1、正则化函数使用
2、lambda函数应用，被称为万能函数
3、matplotlib绘图的熟练应用

二品芝麻狐

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
1
评论
Datawhale数据分析之学术前沿分析学习笔记（三）

Task3:论⽂代码统计一、任务说明？二、使用步骤1.引入库2.读入数据3.数据预处理4.图表展示4.1 统计各类别论文的平均数总结一、任务说明？论⽂代码统计，统计所有论⽂出现代码的相关统计。二、使用步骤1.引入库import jsonimport reimport matplotlib.pyplot as pltimport pandas as pdimport numpy as np2.读入数据代码如下（示例）：data = []with open('arxiv-met
复制链接

扫一扫