论文数据分析-1(论文数据统计)

最新推荐文章于 2024-04-25 10:36:02 发布

埋在地里的小土豆

最新推荐文章于 2024-04-25 10:36:02 发布

阅读量2.2k

点赞数

分类专栏：数据分析实践

本文链接：https://blog.csdn.net/qq_36559719/article/details/112597845

版权

这篇博客介绍了使用Pandas进行论文数据分析的实例，主要内容包括数据预处理、统计2019年计算机领域论文数量，并对论文类别进行了详细分析，尤其是计算机视觉与模式识别类别的突出表现。

摘要由CSDN通过智能技术生成

这是在学习数据分析的一个实例，论文数据分析，这是第一部分，笔者刚学习此项内容，有问题大家提出来，不喜勿喷。

任务1：论文数据统计1

1.1 任务说明

任务主题：论文数量统计，即统计2019年全年计算机各个方向论文数量；
任务内容：赛题的理解、使用 Pandas 读取数据并进行统计；
任务成果：学习 Pandas 的基础操作；
可参考的学习资料：开源组织Datawhale joyful-pandas项目

import pandas as pd
import numpy as np
import json
import re

data  = [] #初始化
#使用with语句优势：1.自动关闭文件句柄；2.自动显示（处理）文件读取数据异常
with open(r'arxiv-metadata-oai-2019.json','r') as f: 
    for line in f: 
        data.append(json.loads(line))
        
data = pd.DataFrame(data) #将list变为dataframe格式，方便使用pandas进行分析
data.shape #显示数据大小

(170618, 14)

data.head(3)

	id	submitter	authors	title	comments	journal-ref	doi	report-no	categories	license	abstract	versions	update_date	authors_parsed
0	0704.0297	Sung-Chul Yoon	Sung-Chul Yoon, Philipp Podsiadlowski and Step...	Remnant evolution after a carbon-oxygen white ...	15 pages, 15 figures, 3 tables, submitted to M...	None	10.1111/j.1365-2966.2007.12161.x	None	astro-ph	None	We systematically explore the evolution of t...	[{'version': 'v1', 'created': 'Tue, 3 Apr 2007...	2019-08-19	[[Yoon, Sung-Chul, ], [Podsiadlowski, Philipp,...
1	0704.0342	Patrice Ntumba Pungu	B. Dugmore and PP. Ntumba	Cofibrations in the Category of Frolicher Spac...	27 pages	None	None	None	math.AT	None	Cofibrations are defined in the category of ...	[{'version': 'v1', 'created': 'Tue, 3 Apr 2007...	2019-08-19	[[Dugmore, B., ], [Ntumba, PP., ]]
2	0704.0360	Zaqarashvili	T.V. Zaqarashvili and K Murawski	Torsional oscillations of longitudinally inhom...	6 pages, 3 figures, accepted in A&A	None	10.1051/0004-6361:20077246	None	astro-ph	None	We explore the effect of an inhomogeneous ma...	[{'version': 'v1', 'created': 'Tue, 3 Apr 2007...	2019-08-19	[[Zaqarashvili, T. V., ], [Murawski, K, ]]

数据集的格式如下：

id：arXiv ID，可用于访问论文；
submitter：论文提交者；
authors：论文作者；
title：论文标题；
comments：论文页数和图表等其他信息；
journal-ref：论文发表的期刊的信息；
doi：数字对象标识符，https://www.doi.org；
report-no：报告编号；
categories：论文在 arXiv 系统的所属类别或标签；
license：文章的许可证；
abstract：论文摘要；
versions：论文版本；
authors_parsed：作者的信息。

由上可看出该数据有170618条数据，14个特征。

数据预处理

#首先我们先来粗略统计论文的种类信息：
data["categories"].describe()
#count：一列数据的元素个数；
#unique：一列数据中元素的种类；
#top：一列数据中出现频率最高的元素；
#freq：一列数据中出现频率最高的元素的个数；

count     170618
unique     15592
top        cs.CV
freq        5559
Name: categories, dtype: object

以上的结果表明：共有170681个数据，有15592个子类（因为有论文的类别是多个，例如一篇paper的类别是CS.AI & CS.MM和一篇paper的类别是CS.AI & CS.OS属于不同的子类别，这里仅仅是粗略统计），其中最多的种类是CS.CV，即Computer Vision and Pattern Recognition计算机视觉，共出现了5559次。

由于部分论文的类别不止一种，所以下面我们判断在本数据集中共出现了多少种独立的数据集。

unique_categories = set([i for l in [x.split(' ') for x in data["categories"]] for i in l])
len(unique_categories

最低0.47元/天解锁文章

埋在地里的小土豆

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
1
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录