Datawhale零基础入门NLP赛事 - Task2 数据读取与数据分析

最新推荐文章于 2020-12-06 17:01:15 发布

友谊无价

最新推荐文章于 2020-12-06 17:01:15 发布

阅读量145

点赞数

分类专栏：数据分析文章标签：数据分析

本文链接：https://blog.csdn.net/qq_24294439/article/details/107525215

版权

10 篇文章 0 订阅

订阅专栏

用pandas处理一下数据，训练集的shape为(200000, 2)，建议刚开始可以读取几百条看看效果，全部读取的话内存大概要12G左右才能进行正常处理。

import pandas as pd
train_df = pd.read_csv('data/train_set.csv', sep='\t')

train_df.head()
train_df.shape

在读取完成数据集后，我们还可以对数据集进行数据分析的操作。虽然对于非结构数据并不需要做很多的数据分析，但通过数据分析还是可以找出一些规律的。

此步骤我们读取了所有的训练集数据，在此我们通过数据分析希望得出以下结论：

句子长度分析

在赛题数据中每行句子的字符使用空格进行隔开，所以可以直接统计单词的个数来得到每个句子的长度。统计并如下：

%pylab inline
train_df['text_len'] = train_df['text'].apply(lambda x: len(x.split(' ')))
print(train_df['text_len'].describe())

对新闻句子的统计可以得出，本次赛题给定的文本比较长，每个句子平均由907个字符构成，最短的句子长度为2，最长的句子长度为57921。

新闻类别分布

接下来可以对数据集的类别进行分布统计，具体统计每类新闻的样本个数。

train_df['label'].value_counts().plot(kind='bar')
plt.title('News class count')
plt.xlabel("category")

在数据集中标签的对应的关系如下：{'科技': 0, '股票': 1, '体育': 2, '娱乐': 3, '时政': 4, '社会': 5, '教育': 6, '财经': 7, '家居': 8, '游戏': 9, '房产': 10, '时尚': 11, '彩票': 12, '星座': 13}

从统计结果可以看出，赛题的数据集类别分布存在较为不均匀的情况。在训练集中科技类新闻最多，其次是股票类新闻，最少的新闻是星座新闻。

关注

专栏目录