初识线性回归
一、线性回归
(一)线性回归的基本含义
线性回归是利用数理统计中回归分析,来确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法,运用十分广泛。其表达形式为y = w’x+e,e为误差服从均值为0的正态分布。
回归分析中,只包括一个自变量和一个因变量,且二者的关系可用一条直线近似表示,这种回归分析称为一元线性回归分析。如果回归分析中包括两个或两个以上的自变量,且因变量和自变量之间是线性关系,则称为多元线性回归分析。
(二)拟合方程—最小二乘法
最小二乘法(又称最小平方法)是一种数学优化技术。它通过最小化误差的平方和寻找数据的最佳函数匹配。利用最小二乘法可以简便地求得未知的数据,并使得这些求得的数据与实际数据之间误差的平方和为最小。
最小二乘法还可用于曲线拟合,其他一些优化问题也可通过最小化能量或最大化熵用最小二乘法来表达。
二、用Excel做线性回归分析
(一)操作步骤
1.选择数据(20组)
2.插入图表—选择散点图
3.生成渐近线
4.设置渐近线格式
5.最终结果
(二)扩展数据进行练习
选取200、2000组数据进行练习
200组数据展示
2000组数据展示
二、用jupyter编程做线性回归分析
首先将数据表格放在jupyter工作目录下,默认是C盘用户文件夹下,即jupyter Home界面所显示的目录
(一)最小二乘法
在编码界面输入以下代码:
import pandas as pd
import numpy as np
import math
#准备数据
p=pd.read_excel('weights_heights(身高-体重数据集).xls','weights_heights')
#根据自己的需要添加,这里选择前20行数据
p1=p.head(20)
x=p1["Height"]
y=p1["Weight"]
# 平均值
x_mean