统计学/机器学习入门(一):简单的线性回归和分类问题

一)线性回归:

首先导入包:

import numpy as np
import matplotlib.pyplot as plt
from sklearn.metrics import mean_squared_error, r2_score, accuracy_score
from sklearn.linear_model import LinearRegression

LinearRegression函数直接创建数据,n_samples表示数据个数,noise是噪音,体现为数据的离散程度:

X, y = datasets.make_regression(n_samples=100, n_features=1, n_targets=1, noise=50
#random_state=42  #如果想让每次都生成同样的点,加这句
)

分割数据为训练数据和测试数据:

X_train = X[:-30] #这个是100-30个数据
X_test = X[-30:] #这是30个数据

y_train = y[:-30]
y_test = y[-30:]

将训练数据放入训练model,并且利用测试数据预测y值:

LR = LinearRegression()
LR.fit(X_train, y_train) #训练数据, 获得斜率,截距等参数
y_pred = LR.predict(X_test) #预测数据
plt.scatter(X_test, y_test, color='black')
plt.plot(X_test, y_pred)

获得以下图像:
在这里插入图片描述
查看相关数据:

print(LR.coef_) #斜率
print(LR.intercept_) #截距
print(mean_squared_error(y_test,y_pred)) #均方误差
print(r2_score(y_test, y_pred)) #决定系数/coefficient of determination
print(LR.score(X_train, y_train)) #查看模型在训练集上的得分
print(LR.score(X_test, y_test)) #测试集上的得分
二)分类问题:

分类问题就是很简单的01问题,是或者不是。这里需要用到sklearn包中的iris花的数据:

from sklearn import datasets
iris = datasets.load_iris()
X = iris.data
y = iris.target #类别,有0,1,2三种类别,这里只取2种
X = X[y<2, :2] #前面这个2是只取y<2的项,后面这个2是取前两列的意思,X本身有4列,
y = y[y<2]

from sklearn.linear_model import LogisticRegression
#导入模型
from sklearn.model_selection import train_test_split
#用于数据分割
X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=42)
LoR = LogisticRegression()
LoR.fit(X_train, y_train) #训练
y_pred = LoR.predict(X_test)
print("y_predict = ", y_pred)
print("y_test", y_test)
print("score on train set", LoR.score(X_train, y_train))
print("score on test set", LoR.score(X_test, y_test))
print("accuracy", accuracy_score(y_test, y_pred))

生成结果如图,发现其在预测集上的得分很好:
在这里插入图片描述
通过画图,更直观感受:

#生成分界线的点
def line(x1):
    return (-LoR.coef_[:,0] * x1 - LoR.intercept_) / LoR.coef_[:,1]
#以下是iris数据点,y==0有两种写法,scatter 画散点
plt.scatter(X[:, 0][y==0], X[y==0, 1], color='red')
plt.scatter(X[y==1, 0], X[y==1, 1], color='blue')
point = np.linspace(4, 8, 100) #4到8均匀生成100个点
plt.plot(point, line(point), c='g') #画分界线
plt.show()

结果如图:
在这里插入图片描述

  • 0
    点赞
  • 16
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值