knn算法的原理和实现流程及在sklearn中调用knn算法

最新推荐文章于 2024-06-19 14:40:49 发布

Baymax_Bai

最新推荐文章于 2024-06-19 14:40:49 发布

阅读量883

点赞数

分类专栏：机器学习算法文章标签：机器学习最近邻分类算法 python 算法数据分析

本文链接：https://blog.csdn.net/Baymax_Bai/article/details/108270858

版权

算法同时被 2 个专栏收录

2 篇文章 0 订阅

订阅专栏

机器学习

1 篇文章 0 订阅

订阅专栏

knn算法的原理和实现流程

import numpy as np
from matplotlib import pyplot as plt

raw_data_X = [[3.3935, 2.3312],
              [3.1101, 1.7815],
              [1.3438, 3.3684],
              [3.5823, 4.6792],
              [2.2804, 2.8670],
              [7.4234, 4.6965],
              [5.7451, 3.5340],
              [9.1722, 2.5111],
              [7.7928, 3.4241],
              [7.9398, 0.7916]]
raw_data_y =[0, 0, 0, 0, 0, 1, 1, 1, 1, 1]  #  0代表良性肿瘤，1代表恶性肿瘤

X_train = np.array(raw_data_X)
y_train = np.array(raw_data_y)
# X_train.shape
# y_train.shape

plt.scatter(X_train[y_train==0,0],X_train[y_train==0,1],color='r')
plt.scatter(X_train[y_train==1,0],X_train[y_train==1,1],color='b')
plt.show()

在这里插入图片描述

# 给定待预测数据，预测他的结果
x = np.array([8.0936, 3.3657])
plt.scatter(X_train[y_train==0,0],X_train[y_train==0,1],color='r')
plt.scatter(X_train[y_train==1,0],X_train[y_train==1,1],color='b')
plt.scatter(x[0],x[1],color='g')
plt.show()

在这里插入图片描述

# 计算每一个点到绿色点的距离
from math import sqrt
distance = []  # 保存和其他所有点的距离
for x_train in X_train:
    """方法一，适用于二维"""
    distance.append(sqrt((x_train[0]-x[0])**2+(x_train[1]-x[1])**2))
    """方法二，适用于多维"""
#     distance.append(sqrt(np.sum((x_train-x)**2)))
    
"""方法三，列表生成式"""
# distance = [sqrt(np.sum((x_train-x)**2)) for x_train in X_train]

#  找出离待预测的点距离最近的k个点
k = 3
nearest = np.argsort(distance)

# 找出最近的k个点下标值以后，找出这些样本对应的目标值
y_train[nearest]

top_K = [i for i in y_train[nearest]]

# 计算投票结果
from collections import Counter
votes = Counter(top_K)

# 其他的计票方法
votes_test = Counter([1,1,0,2,2,2]) # 传入一个列表
votes_test

y_predict = votes.most_common(1)[0][0]

在sklearn中调用knn算法

from sklearn.neighbors import KNeighborsClassifier
import numpy as np

knn_clf = KNeighborsClassifier()

raw_data_X = [[3.3935, 2.3312],
              [3.1101, 1.7815],
              [1.3438, 3.3684],
              [3.5823, 4.6792],
              [2.2804, 2.8670],
              [7.4234, 4.6965],
              [5.7451, 3.5340],
              [9.1722, 2.5111],
              [7.7928, 3.4241],
              [7.9398, 0.7916]]
raw_data_y =[0, 0, 0, 0, 0, 1, 1, 1, 1, 1]  #  0代表良性肿瘤，1代表恶性肿瘤
X_train = np.array(raw_data_X)
y_train = np.array(raw_data_y)

knn_clf.fit(X_train,y_train)

x = np.array([8.0936, 3.3657]).reshape(1,-1)
knn_clf.predict(x)