机器学习中过拟合和欠拟合的案例代码分析_多项式欠拟合过拟合代码-CSDN博客

本文链接：https://blog.csdn.net/qq_42837441/article/details/125457482

该博客探讨了线性回归在处理非线性数据时的局限性，并通过实例展示了如何通过添加二次项和其他高次项提高模型拟合度。通过比较不同次数的多项式回归，说明了增加特征项能降低均方误差，从而提高预测精度。同时，文章提到了欠拟合和过拟合的概念，以及对应的解决策略，如特征选择、数据清洗和正则化等。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

import numpy as np
import matplotlib.pyplot as plt
np.random.seed(666)
x = np.random.uniform(-3,3,size = 100) #均匀随机分布
# 线性回归模型需要二维数组
X = x.reshape(-1,1) 

y = 0.5* x**2 + x+2 +np.random.normal(0,1,size = 100)#+np...均值为0方差为1正态分布的噪声

from sklearn.linear_model import LinearRegression  
estimator = LinearRegression()
estimator.fit(X,y)
y_predict = estimator.predict(X)
#绘制图像
plt.scatter(x,y)
plt.plot(x,y_predict,color = 'r')
plt.show()

在这里插入图片描述

 #计算均方误差
from sklearn.metrics import mean_squared_error
mean_squared_error(y,y_predict)

#3.0750025765636577

添加二次项，绘制图像

X2 = np.hstack([X,X**2])
estimator2 = LinearRegression()
estimator2.fit(X2,y)
y_predict2 = estimator2.predict(X2)

plt.scatter(x,y)
plt.plot(np.sort(x),y_predict2[np.argsort(x)],color = 'r')
plt.show()

在这里插入图片描述

#计算均方误差和准确率

from sklearn.metrics import mean_squared_error
mean_squared_error(y,y_predict2)

#1.0987392142417858

可以看到二次拟合更精准

再次加入高次项，绘制图像，观察均方误差结果

X5 = np.hstack([X2,X**3,X**4,X**5,X**6,X**7,X**8,X**9,X**10])

estimator3 = LinearRegression()
estimator3.fit(X5,y)
y_predict5 = estimator3.predict(X5)

plt.scatter(x,y)
plt.plot(np.sort(x),y_predict5[np.argsort(x)],color = 'r')#np.sort排序x从小到大排序
plt.show()

error = mean_squared_error(y, y_predict5)
error

#1.0508466763764157

在这里插入图片描述

随着加入的高次项越来越多，拟合程度越来越高，均方误差也随着加入越来越小。

X的测试集均方误差

X_train,X_test,y_train,y_test = train_test_split(X,y,random_state = 5)
estimator = LinearRegression()
estimator.fit(X_train,y_train)
y_predict = estimator.predict(X_test)

mean_squared_error(y_test,y_predict)
#3.153139806483088

X2的测试集均方误差

X_train,X_test,y_train,y_test = train_test_split(X2,y,random_state = 5)
estimator = LinearRegression()
estimator.fit(X_train,y_train)
y_predict = estimator.predict(X_test)
mean_squared_error(y_test,y_predict)
#1.111873885731967

X5的测试集的均方误差

X_train,X_test,y_train,y_test = train_test_split(X5,y,random_state = 5)
estimator = LinearRegression()
estimator.fit(X_train,y_train)
y_predict = estimator.predict(X_test)
mean_squared_error(y_test,y_predict)
#1.4145580542309835