基于论文摘要的文本分类与关键词抽取挑战赛 DataWhale NLP夏令营(1)-CSDN博客

本文链接：https://blog.csdn.net/q2544048170/article/details/131864499

该文介绍了一个挑战赛，任务是进行文本类别分类和关键词抽取。文中提供了一个基础的Python代码示例，使用了词袋模型（BOW）和逻辑回归（LogisticRegression），并提到TF-IDF模型可能有更好的效果。挑战数据集包含title、author、abstract和Keywords字段。

摘要由CSDN通过智能技术生成

挑战赛介绍

比赛链接
比赛要求根据文本进行类别的分类，以及根据文本的摘要题目提取出文本中的关键词.

baseline代码:

# 导入pandas用于读取表格数据
import pandas as pd

# 导入BOW（词袋模型），可以选择将CountVectorizer替换为TfidfVectorizer（TF-IDF（词频-逆文档频率）），注意上下文要同时修改，亲测后者效果更佳
from sklearn.feature_extraction.text import CountVectorizer

# 导入LogisticRegression回归模型
from sklearn.linear_model import LogisticRegression

# 过滤警告消息
from warnings import simplefilter
from sklearn.exceptions import ConvergenceWarning
simplefilter("ignore", category=ConvergenceWarning)


# 读取数据集
train = pd.read_csv('./基于论文摘要的文本分类与关键词抽取挑战赛公开数据/train.csv')
train['title'] = train['title'].fillna('')
train['abstract'] = train['abstract'].fillna('')

test = pd.read_csv('./基于论文摘要的文本分类与关键词抽取挑战赛公开数据/test.csv')
test['title'] = test['title'].fillna('')
test['abstract'] = test['abstract'].fillna('')


# 提取文本特征，生成训练集与测试集
train['text'] = train['title'].fillna('') + ' ' +  train['author'].fillna('') + ' ' + train['abstract'].fillna('')+ ' ' + train['Keywords'].fillna('')
test['text'] = test['title'].fillna('') + ' ' +  test['author'].fillna('') + ' ' + test['abstract'].fillna('')+ ' ' + train['Keywords'].fillna('')

vector = CountVectorizer().fit(train['text'])
train_vector = vector.transform(train['text'])
test_vector = vector.transform(test['text'])


# 引入模型
model = LogisticRegression()

# 开始训练，这里可以考虑修改默认的batch_size与epoch来取得更好的效果
model.fit(train_vector, train['label'])

# 利用模型对测试集label标签进行预测
test['label'] = model.predict(test_vector)

# 生成任务一推测结果
test[['uuid', 'Keywords', 'label']].to_csv('submit_task1.csv', index=None)

代码解释

文本的数据为title,author,abstract.
在这里插入图片描述

处理文本的方法

单个样本的数据量较小，故baseline中采用的方法为普通的机器学习方法。使用sklean中的CountVectorize,(使用词频向量表示文本信息)或者TfidfVectorize,同样使用向量表示文本信息，但是向量中的每个元素为词语tf-idf值.

# 提取文本特征，生成训练集与测试集
train['text'] = train['title'].fillna('') + ' ' +  train['author'].fillna('') + ' ' + train['abstract'].fillna('')+ ' ' + train['Keywords'].fillna('')
test['text'] = test['title'].fillna('') + ' ' +  test['author'].fillna('') + ' ' + test['abstract'].fillna('')+ ' ' + train['Keywords'].fillna('')

vector = CountVectorizer().fit(train['text'])
train_vector = vector.transform(train['text'])
test_vector = vector.transform(test['text'])

在进行完文本的转换后，可以将数据使用SVC支持向量机模型，Logistic Regression等众多机器学习模型进行处理.

# 引入模型
model = SVC()

# 开始训练，这里可以考虑修改默认的batch_size与epoch来取得更好的效果
model.fit(train_vector, train['label'])
# 利用模型对测试集label标签进行预测
test['label'] = model.predict(test_vector)