【统计学习方法】朴素贝叶斯对鸢尾花(iris)数据集进行训练预测

本文摘要
· 理论来源:【统计学习方法】第三四章 朴素贝叶斯
· 技术支持:pandas(读csv)、numpy、sklearn.naive_bayes.GaussianNB(高斯朴素贝叶斯模型)、sklearn.model_selection.cross_val_score(用于进行k折交叉验证)
· 代码目的:利用sklearn提供的高斯贝叶斯模型,对鸢尾花数据集进行学习+预测
作者:CSDN 征途黯然.

  

1、建议去了解一下,高斯、伯努利、多项式的朴素贝叶斯
2、突然间觉得sklearn很香,不想手撸模型了……

一、鸢尾花(iris)数据集

  Iris 鸢尾花数据集是一个经典数据集,在统计学习和机器学习领域都经常被用作示例。数据集内包含 3 类共 150 条记录,每类各 50 个数据,每条记录都有 4 项特征:花萼长度、花萼宽度、花瓣长度、花瓣宽度,可以通过这4个特征预测鸢尾花卉属于(iris-setosa, iris-versicolour, iris-virginica)中的哪一品种。
下载地址:点击此处

二、代码描述

  1、首先,导入鸢尾花数据集

  2、然后,数据预处理,数据集分成特征集和标签集

  3、最后,实例化高斯贝叶斯模型,进行k折交叉检验,查看准确率
在这里插入图片描述

三、python代码(注释详细)

import pandas as pd
import numpy as np
from sklearn.naive_bayes import GaussianNB  #导入模型
from sklearn.model_selection import cross_val_score


# 导入数据集
df = pd.read_csv('./iris/Iris.csv', usecols=[1, 2, 3, 4, 5])

# pandas打印表格信息
# print(df.info())

# pandas查看数据集的头5条记录
# print(df.head())

"""数据预处理"""
# 取前100条数据中的:前4个特征+标签,便于训练
data = np.array(df.iloc[:150, [0, 1, 2, 3, -1]])
# 数据类型转换,为了后面的数学计算
X, y = data[:, :-1], data[:, -1]
# 标签不需要是数字,字符串并不影响
# y = np.array([1 if i == 'Iris-setosa' else -1 for i in y])


"""调用sklearn提供的kNN算法"""
clf = GaussianNB()

print(cross_val_score(clf, X, y, cv=5))
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

征途黯然.

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值