AI夏令营-nlp笔记(1)

最新推荐文章于 2024-08-20 10:58:52 发布

R.E.H.

最新推荐文章于 2024-08-20 10:58:52 发布

阅读量50

点赞数 1

文章标签：人工智能自然语言处理笔记

本文链接：https://blog.csdn.net/weixin_73992180/article/details/132338568

版权

使用baseline方法进行基于摘要，标题等信息判断论文是否属于医学领域的文献。

实现目标需要文章特征提取和拟合模型两个主要步骤。

特征提取

这里提到了tf-idf和bow两种向量化方法。TF-IDF(term frequency–inverse document frequency)是一种用于信息检索与数据挖掘的常用加权技术；BOW（Bag of Words）是一种常用的文本表示方法，其基本思想是假定对于一个文本，忽略其词序和语法、句法，仅仅将其看做是一些词汇的集合，而文本中的每个词汇都是独立的。基于原理，使用sklearn中的TfidfVectorizer结合以上两种方法，并使用stop（停用词）提升信息的有效性。但根据原理，根据此类方法得出的特征向量并未包含文章的时序信息，一词多义等特殊情况，仍存在很大改进空间，但优点为直接使用相同规格的向量表示不同文章，无需RNN，transformer等复杂结构，可直接使用神经网络对其拟合

模型拟合

可以看出，本次任务为典型的0-1二分类，因此直接选择逻辑回归，无需考虑决策树，支持向量机等方法。最后对代码改进。

# 导入pandas用于读取表格数据
import pandas as pd

# 导入BOW（词袋模型），可以选择将CountVectorizer替换为TfidfVectorizer（TF-IDF（词频-逆文档频率）），注意上下文要同时修改，亲测后者效果更佳
from sklearn.feature_extraction.text import CountVectorizer
from sklearn.feature_extraction.text import TfidfVectorizer

# 导入LogisticRegression回归模型
from sklearn.linear_model import LogisticRegression

# 过滤警告消息
from warnings import simplefilter
from sklearn.exceptions import ConvergenceWarning
simplefilter("ignore", category=ConvergenceWarning)

#指定停用词
stops =[i.strip() for i in open(r'/home/aistudio/data/data231041/stop.txt',encoding='utf-8').readlines()]

# 读取数据集
train = pd.read_csv('/home/aistudio/data/data231041/train.csv')
train['title'] = train['title'].fillna('')
train['abstract'] = train['abstract'].fillna('')

test = pd.read_csv('/home/aistudio/data/data231041/testB.csv')
test['title'] = test['title'].fillna('')
test['abstract'] = test['abstract'].fillna('')


# 提取文本特征，生成训练集与测试集
train['text'] = train['title'].fillna('') + ' ' +  train['author'].fillna('') + ' ' + train['abstract'].fillna('')+ ' ' + train['Keywords'].fillna('')
test['text'] = test['title'].fillna('') + ' ' +  test['author'].fillna('') + ' ' + test['abstract'].fillna('')

# vector = CountVectorizer(stop_words=stops).fit(train['text'])
# train_vector = vector.transform(train['text'])
# test_vector = vector.transform(test['text'])
vector = TfidfVectorizer(stop_words=stops).fit(train["text"])

train_vector = vector.transform(train['text'])
test_vector = vector.transform(test['text'])

# 引入模型
model = LogisticRegression()

# 开始训练，这里可以考虑修改默认的batch_size与epoch来取得更好的效果
model.fit(train_vector, train['label'])

# 利用模型对测试集label标签进行预测
test['label'] = model.predict(test_vector)
test['Keywords'] = test['title'].fillna('')
test[['uuid','Keywords','label']].to_csv('submit_task1.csv', index=None)

最后结果评分如下图：