机器学习基础DAY4

最新推荐文章于 2024-09-19 16:58:29 发布

Lin叮当

最新推荐文章于 2024-09-19 16:58:29 发布

阅读量178

点赞数

分类专栏：机器学习基础文章标签：机器学习

本文链接：https://blog.csdn.net/gtt683559/article/details/110531616

版权

机器学习基础专栏收录该内容

8 篇文章 0 订阅

订阅专栏

第四章机器学习概述

机器学习一般的数据集会划分为两个部分：
训练数据：用于训练，构建模型
测试数据：在模型检验时使用，用于评估模型是否有效
训练集与测试集占比一般是（0.8,0.2）,(0.7,0.3),(0.75,0.25)，其中最后一种用的最多
在这里插入图片描述

以鸢尾花数据集为例：

from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
li= load_iris()
print(li.data)
print(li.target)
x_train,x_test,y_train,y_test = train_test_split(li.data,li.target,test_size=0.25)
print("训练集特征值和目标值：",x_train,y_train)
print("测试集特征值和目标值：",x_test,y_test)

转换器与预估器：

转换器（transformer）：
fit_transform(）：输入数据直接转换
fit（）：输入数据，但是不做事情，计算平均值方差等等
transform（）：进行数据的转换
注意：调用fit_transform时(对于文档建立分类词频矩阵，不能同时调用)

在sklearn中，估计器(estimator)是一个重要的角色，分类器和回归器都属于estimator，是一类实现了算法的API
1、用于分类的估计器：
sklearn.neighbors k-近邻算法
sklearn.naive_bayes 贝叶斯
sklearn.linear_model.LogisticRegression 逻辑回归
2、用于回归的估计器：
sklearn.linear_model.LinearRegression 线性回归
sklearn.linear_model.Ridge 岭回归