NLTK朴素贝叶斯,文本分类代码示例采样 SMSSpamCollection数据集下载

最新推荐文章于 2023-04-29 19:09:30 发布

光英的记忆

最新推荐文章于 2023-04-29 19:09:30 发布

阅读量2.8k

点赞数 1

分类专栏： NLTK

本文链接：https://blog.csdn.net/qq_29678299/article/details/90549550

版权

该博客介绍了如何利用Python的NLTK库，结合SMSSpamCollection数据集进行朴素贝叶斯文本分类。文章中提供了完整的代码示例，帮助读者理解垃圾邮件过滤的实现过程。

摘要由CSDN通过智能技术生成

https://stackoverflow.com/

文本分类代码编译通过

import nltk
from nltk.corpus import stopwords
from nltk.stem import WordNetLemmatizer
import csv
import numpy as np
from sklearn.feature_extraction.text import CountVectorizer
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.naive_bayes import MultinomialNB
import sklearn.metrics as metrics
from sklearn import tree
from sklearn.linear_model import SGDClassifier
from sklearn.svm import LinearSVC
from sklearn.ensemble import RandomForestClassifier


# 文本清洗预处理
def preprocessing(text):
    # text = text.encode("gbk").decode("utf8")
    # tokons to word 句子标记解析  单词标记解析
    tokens = [word for sent in nltk.sent_tokenize(text) for word in nltk.word_tokenize(sent)]
    # print("单词标记解析：", tokens)
    # 停用词删除
    stop = stopwords.words('english')
    tokens = [token for token in tokens if token not in stop]
    # print("停用词删除", tokens)
    # 单词字数小于3删除 并转换成小写
    tokens = [word.lower() for word in tokens if len(word) >= 3]
    # print("字数小于3删除", tokens)
    # lemmatize
    # 把（文中的词）按屈折变化形式（或异体形式）进行归类
    lemter = WordNetLemmatizer()

最低0.47元/天解锁文章

光英的记忆

关注

1
点赞
踩
13

收藏

觉得还不错? 一键收藏
1
评论
NLTK朴素贝叶斯,文本分类代码示例采样 SMSSpamCollection数据集下载

https://stackoverflow.com/文本分类代码编译通过import nltkfrom nltk.corpus import stopwordsfrom nltk.stem import WordNetLemmatizerimport csvimport numpy as npfrom sklearn.feature_extraction.text im...
复制链接

扫一扫