java朴素贝叶斯算法_朴素贝叶斯算法&应用实例

最新推荐文章于 2024-08-16 20:04:59 发布

搁浅的鲎

最新推荐文章于 2024-08-16 20:04:59 发布

阅读量216

点赞数

文章标签： java朴素贝叶斯算法

本文链接：https://blog.csdn.net/weixin_33767088/article/details/112082759

版权

朴素贝叶斯

朴素贝叶斯中的朴素是指假设各个特征之间相互独立，不会互相影响，所以称为朴素贝叶斯。正是因为这个假设，使得算法的模型简单且容易理解，虽然牺牲了一点准确性，但是如果模型训练的好，也能得到不错的分类效果。

公式简单推导

下面我们简单看一下公式的推导过程

评测指标

我们得出分类的结果后，怎么来评测我们训练的模型的好与不好呢？我们通常「准确度」「精确率」「召回率」这几个指标来进行判断模型的好坏。下边我们用一个简单的例子来说明这几个指标是怎么计算的。

下面我们看一个表。

表中表示实际上科技类的文章有 40 篇，财经类的有 30 篇，然而预测的结果科技类的有 35 篇，其中 30 篇预测正确了，有 5 篇预测错误了；预测结果财经类的有 35 篇，其中 25 篇预测正确了，10 篇预测错误了。

准确度

表示预测正确的文章数比上总的文章数：(30+25)/(40+30)=78%

精确率

表示每一类预测正确的数量比上预测的该类文章总数量，比如科技类精确率：30/(30+5)=85%

召回率

表示每一类预测正确的数量比上实际该类的总数量，比如科技类：30/40=75%

应用实例

上边我们已经了解了朴素贝叶斯公式及推导过程，下边我们来看一下在实际的新闻分类中的应用。

元数据的准备，我们的元数据是网上找来的一些各类的新闻，这里为了简单，我们只选取了科技、财经和体育三类数量不等的新闻，并且都已知他们的类别。然后通过中文结巴分词

对每篇新闻进行分词。这里我们用到的是gihub上的一个开源的python库，有兴趣的可以了解一下。

下面我们来看一下代码的具体实现。

首先我们先把汉字的文章转成每个词所对应的数字id的形式，方便我们后边的操作和计算。

Convert.py

import osimport sysimport randomimport reinputPath = sys.argv[1]outputFile = sys.argv[2]#训练集所占百分比trainPercent = 0.8wordDict = {}wordList = []trainOutputFile = open('%s.train' % outputFile, "w")testOutputFile = open('%s.test' % outputFile, "w")for fileName in os.listdir(inputPath): tag = 0 if fileName.find('technology') != -1: tag = 1 elif fileName.find('business') != -1: tag = 2 elif fileName.find('sport') != -1: tag = 3 outFile = trainOutputFile rd = random.random() if rd >= trainPercent: outFile = testOutputFile inputFile = open(inputPath+'/'+fileName, "r") content = inputFile.read().strip() content = content.decode('utf-8', 'ignore') content = content.replace('', ' ') r1 = u'[a-zA-Z0-9’!"#$%&'()*+,-./:;<=>?@，。?★、…【】《》？“”‘’！[]^_`{|}~]+' content = re.sub(r1, '', content) outFile.write(str(tag)+' ') words = content.split(' ') for word in words: if word not in wordDict: wordList.append(word) wordDict[word] = len(wordList) outFile.write(str(wordDict[word]) + ' ') inputFile.close()trainOutputFile.close()testOutputFile.close()

朴素贝叶斯实现过程

NB.py

#Usage:#Training: NB.py 1 TrainingDataFile ModelFile#Testing: NB.py 0 TestDataFile ModelFile OutFileimport sysimport osimport mathDefaultFreq = 0.1TrainingDataFile = "nb_data.train"ModelFile = "nb_data.model"TestDataFile = "nb_data.test"TestOutFile = "nb_data.out"ClassFeaDic = {}ClassFreq = {}WordDic = {}ClassFeaProb = {}ClassDefaultProb = {}ClassProb = {}#加载数据def LoadData(): i =0 infile = open(TrainingDataFile, 'r') sline = infile.readline().strip() while len(sline) > 0: pos = sline.find("#") if pos > 0: sline = sline[:pos].strip() words = sline.split(' ') if len(words) < 1: print("Format error!") break classid = int(words[0]) if classid not in ClassFeaDic: ClassFeaDic[classid] = {} ClassFeaProb[classid] = {} ClassFreq[classid] = 0 ClassFreq[classid] += 1 words = words[1:] for word in words: if len(word) < 1: continue wid = int(word) if wid not in WordDic: WordDic[wid] = 1 if wid not in ClassFeaDic[classid]: ClassFeaDic[classid][wid] = 1 else: ClassFeaDic[classid][wid] += 1 i += 1 sline = infile.readline().strip() infile.close() print(i, "instances loaded!") print(len(ClassFreq), "classes!

搁浅的鲎

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫