通过Keras + LSTM进行文本分类

最新推荐文章于 2024-05-16 22:46:10 发布

一摩尔自由

最新推荐文章于 2024-05-16 22:46:10 发布

阅读量1.1k

点赞数

分类专栏：文本分类深度学习模型 NLP

本文链接：https://blog.csdn.net/Barry_J/article/details/99941921

版权

本文介绍如何运用Keras库配合LSTM模型对IMDB电影评论数据集进行文本分类。数据集可在Kaggle官网或指定百度网盘链接获取，详细步骤和参考资料已提供。

摘要由CSDN通过智能技术生成

利用LSTM对IMDB Reviwe文本进行分类，数据集可以在kaggle官网上获取，
kaggle比赛
或者https://pan.baidu.com/s/1EYoqAcW238saKy3uQCfC3w
提取码：ilze

# 导入相应的包
import pandas as pd
import warnings
import re
import matplotlib.pyplot as plt
from nltk.stem import WordNetLemmatizer
from nltk.corpus import stopwords
from keras.preprocessing.text import Tokenizer
from keras.preprocessing.sequence import pad_sequences
from keras.layers import Dense, LSTM, Embedding, Dropout, Conv1D, MaxPooling1D, Bidirectional
from keras.models import Sequential

warnings.filterwarnings('ignore')

#　读取数据
df1 = pd.read_csv('word2vec-nlp-tutorial/labeledTrainData.tsv', sep='\t', error_bad_lines=False)
df2 = pd.read_csv('word2vec-nlp-tutorial/imdb_master.csv', encoding="latin-1")
df3 = pd.read_csv('word2vec-nlp-tutorial/testData.tsv', sep='\t', error_bad_lines=False)

df2 = df2.drop(['Unnamed: 0','type','file'],axis=1)
df2.columns = ["review","sentiment"]
df2 = df2[df2.sentiment != 'unsup']
df2['sentiment'] = df2['sentiment'].map({'pos': 1, 'neg': 0})

＃　合并数据
df = pd.concat([df1, df2]).reset_index(drop=True)

train_texts = df.review
train_labels = df.sentime