原 任务1-数据初始

首先明确任务:
建立模型通过长文本数据正文(article),预测文本对应的类别(class)

确定好任务之后我们先对数据进行读取,DataFrames的head()方法,看看数据的前五行是如何的

import sys
assert sys.version_info >= (3, 5)
import sklearn
assert sklearn.__version__ >= "0.20"
import numpy as np
import os

training_data= pd.read_csv('./train_set.csv', nrows=5000)
#training_data = pd.read_csv(csv_path, nrows=5000)
training_data.head()

通过上面得知,数据集就只有“id”,“article”,“word_seg”,“class”等四个属性,其中特征就是“article”,和“word_reg” 。
然后我们可以查看官网,文章分别在“字”和“词”的级别上做了脱敏处理。共有四列:
第一列是文章的索引(id),第二列是文章正文在“字”级别上的表示,即字符相隔正文(article);第三列是在“词”级别上的表示,即词语相隔正文(word_seg);第四列是这篇文章的标注(class)。
注:每一个数字对应一个“字”,或“词”,或“标点符号”。“字”的编号与“词”的编号是独立的!

这样我们可以再采用info()的方法来快速获取数据集的简单描述,特别是总行数,每个属性的类型和非空值的数量
training_data.info()
 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值