【计算机设计大赛近年获奖信息】数据分析及可视化

本文链接：https://blog.csdn.net/2401_84545088/article/details/138796720

给大家的福利

零基础入门

对于从来没有接触过网络安全的同学，我们帮你准备了详细的学习成长路线图。可以说是最科学最系统的学习路线，大家跟着这个大的方向学习准没问题。

同时每个成长路线对应的板块都有配套的视频提供：

在这里插入图片描述

因篇幅有限，仅展示部分资料

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化资料的朋友，可以点击这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

	- [获奖作品名称热词](#_233)
+ [总结](#_298)

写在前面

本文通过最近三年 “中国大学生计算机设计大赛” 的获奖数据（2021结果尚未揭晓），分析挖掘一下该比赛深层的一些内容，主要有以下几点：

各年各奖项的比例分布
各年得奖最多的学校 Top10
哪些学校多次进入得奖最多 Top10
各学校三年中参赛次数统计
各级别奖项中学校层次划分
参赛人数与奖项之间的关系
获奖作品名称热词

文中各部分中如果代码量较多的，为了阅读体验，就不进行展示，如需代码及相关文件可以私信我。

数据读取及描述

数据集是大赛官方提供的数据，2018、2019 年数据为.xlsx文件，2020 年数据为.pdf文件。先读取 2018 、2019 年数据，并观察一下数据集信息。

import pandas as pd

df_2018 = pd.read_excel('2018年决赛正式结果.xlsx', sheet_name='123等奖')
df_2019 = pd.read_excel('2019年大赛获奖作品名单公示20190907.xlsx')

在这里插入图片描述

df_2019.info()

在这里插入图片描述

通过上图中的信息可以看到，2018 年与 2019 年的数据集格式有挺大的差异，这些在之后合并时需要统一。

由于 2020 年的数据是 .pdf 文件，我们单独定义一个函数来读取。对于读取时的一些细节问题，都已在代码中以注释的形式标出。

import pdfplumber

def read\_pdf\_2020(read_path):
    pdf_2020 = pdfplumber.open(read_path)
    result_df = pd.DataFrame()
    for page in pdf_2020.pages:
        table = page.extract_table()
        df_detail = pd.DataFrame(table[1:], columns=table[0])
        # 合并每页的数据集