相关概念 ·生成模型:在概率统计理论中, 生成模型是指能够随机生成观测数据的模型,尤其是在给定某些隐含参数的条件下。它给观测值和标注数据序列指定一个联合概率分布。在机器学习中,生成模型可以用来直接对数据建模(例如根据某个变量的概率密度函数进行数据采样),也可以用来建立变量间的条件概率分布。条件概率分布可以由生成模型根据贝叶斯定理形成。常见的基于生成模型算法有高斯混合模型和其他混合模型、隐马尔可夫模型、随机上下文无关文法、朴素贝叶斯分类器、AODE分类器、潜在狄利克雷分配模型、受限玻尔兹曼机 举例:利用生成模型是根据好瓜的特征首先学习出一个好瓜的模型,然后根据坏瓜的特征学习得到一个坏瓜的模型,然后从需要预测的瓜中提取特征,放到生成好的好瓜的模型中看概率是多少,在放到生产的坏瓜模型中看概率是多少,哪个概率大就预测其为哪个。 ·判别模型: 在机器学习领域判别模型是一种对未知数据 y 与已知数据 x 之间关系进行建模的方法。判别模型是一种基于概率理论的方法。已知输入变量 x ,判别模型通过构建条件概率分布 P(y|x) 预测 y 。常见的基于判别模型算法有逻辑回归、线性回归、支持向量机、提升方法、条件随机场、人工神经网络、随机森林、感知器 举例:要确定一个瓜是好瓜还是坏瓜,用判别模型的方法是从历史数据中学习到模型,然后通过提取这个瓜的特征来预测出这只瓜是好瓜的概率,是坏瓜的概率。
先验概率和后验概率 ·条件概率: 就是事件A在事件B发生的条件下发生的概率。条件概率表示为P(A|B),读作“A在B发生的条件下发生的概率”。 ·先验概率: 在贝叶斯统计中,某一不确定量 p 的先验概率分布是在考虑"观测数据"前,能表达 p 不确定性的概率分布。它旨在描述这个不确定量的不确定程度,而不是这个不确定量的随机性。这个不确定量可以是一个参数,或者是一个隐含变量。 ·后验概率: 在贝叶斯统计中,一个随机事件或者一个不确定事件的后验概率是在考虑和给出相关证据或数据后所得到的条件概率。同样,后验概率分布是一个未知量(视为随机变量)基于试验和调查后得到的概率分布。“后验”在本文中代表考虑了被测试事件的相关证据。 ·举例: 通过上述西瓜的数据集来看 条件概率,就是在条件为瓜的颜色是青绿的情况下,瓜是好瓜的概率 先验概率,就是常识、经验、统计学所透露出的“因”的概率,即瓜的颜色是青绿的概率。 后验概率,就是在知道“果”之后,去推测“因”的概率,也就是说,如果已经知道瓜是好瓜,那么瓜的颜色是青绿的概率是多少。后验和先验的关系就需要运用贝叶斯决策理论来求解。
# -*- coding: utf-8 -*-"""
Created on Tue Apr 21 09:13:15 2020
@author: 一只腰鱼
"""from sklearn.naive_bayes import GaussianNB
from sklearn.datasets import load_iris
import pandas as pd
from sklearn.model_selection import train_test_split
iris = load_iris()
X_train, X_test, y_train, y_test = train_test_split(iris.data, iris.target, test_size=0.2)
clf = GaussianNB().fit(X_train, y_train)print("Classifier Score:", clf.score(X_test, y_test))import math
classNaiveBayes:def__init__(self):
self.model =None# 数学期望
@staticmethoddefmean(X):"""计算均值
Param: X : list or np.ndarray
Return:
avg : float
"""
avg =0.0# ========= show me your code ==================
avg =sum(X)/float(len(X))# ========= show me your code ==================return avg
# 标准差(方差)defstdev(self, X):"""计算标准差
Param: X : list or np.ndarray
Return:
res : float
"""
res =0.0# ========= show me your code ==================
avg = self.mean(X)
res = math.sqrt(sum([pow(x - avg,2)for x in X])/float(len(X)))# ========= show me your code ==================return res
# 概率密度函数defgaussian_probability(self, x, mean, stdev):"""根据均值和标注差计算x符号该高斯分布的概率
Parameters:
----------
x : 输入
mean : 均值
stdev : 标准差
Return:
res : float, x符合的概率值
"""
res =0.0# ========= show me your code ==================
exponent = math.exp(-(math.pow(x - mean,2)/(2* math.pow(stdev,2))))
res =(1/(math.sqrt(2* math.pi)* stdev))* exponent
# ========= show me your code ==================return res
# 处理X_traindefsummarize(self, train_data):"""计算每个类目下对应数据的均值和标准差
Param: train_data : list
Return : [mean, stdev]
"""
summaries =[0.0,0.0]# ========= show me your code ==================
summaries =[(self.mean(i), self.stdev(i))for i inzip(*train_data)]# ========= show me your code ==================return summaries
# 分类别求出数学期望和标准差deffit(self, X, y):
labels =list(set(y))
data ={label:[]for label in labels}for f, label inzip(X, y):
data[label].append(f)
self.model ={
label: self.summarize(value)for label, value in data.items()}return'gaussianNB train done!'# 计算概率defcalculate_probabilities(self, input_data):"""计算数据在各个高斯分布下的概率
Paramter:
input_data : 输入数据
Return:
probabilities : {label : p}
"""# summaries:{0.0: [(5.0, 0.37),(3.42, 0.40)], 1.0: [(5.8, 0.449),(2.7, 0.27)]}# input_data:[1.1, 2.2]
probabilities ={}# ========= show me your code ==================for label, value in self.model.items():
probabilities[label]=1for i inrange(len(value)):
mean, stdev = value[i]
probabilities[label]*= self.gaussian_probability(
input_data[i], mean, stdev)# ========= show me your code ==================return probabilities
# 类别defpredict(self, X_test):# {0.0: 2.9680340789325763e-27, 1.0: 3.5749783019849535e-26}
label =sorted(self.calculate_probabilities(X_test).items(), key=lambda x: x[-1])[-1][0]return label
# 计算得分defscore(self, X_test, y_test):
right =0for X, y inzip(X_test, y_test):
label = self.predict(X)if label == y:
right +=1return right /float(len(X_test))
model = NaiveBayes()
model.fit(X_train, y_train)