K-近邻（KNN）算法

最新推荐文章于 2023-04-01 16:41:01 发布

yj2434

最新推荐文章于 2023-04-01 16:41:01 发布

阅读量131

点赞数

分类专栏： # sparkMLlib

本文链接：https://blog.csdn.net/yj2434/article/details/110025235

版权

sparkMLlib 专栏收录该内容

2 篇文章 0 订阅

订阅专栏

一 . K-近邻算法（KNN）概述

最简单最初级的分类器是将全部的训练数据所对应的类别都记录下来，当测试对象的属性和某个训练对象的属性完全匹配时，便可以对其进行分类。但是怎么可能所有测试对象都会找到与之完全匹配的训练对象呢，其次就是存在一个测试对象同时与多个训练对象匹配，导致一个训练对象被分到了多个类的问题，基于这些问题呢，就产生了KNN。
KNN是通过测量不同特征值之间的距离进行分类。它的思路是：如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别，则该样本也属于这个类别，其中K通常是不大于20的整数。KNN算法中，所选择的邻居都是已经正确分类的对象。该方法在定类决策上只依据最邻近的一个或者几个样本的类别来决定待分样本所属的类别。
下面通过一个简单的例子说明一下：如下图，绿色圆要被决定赋予哪个类，是红色三角形还是蓝色四方形？如果K=3，由于红色三角形所占比例为2/3，绿色圆将被赋予红色三角形那个类，如果K=5，由于蓝色四方形比例为3/5，因此绿色圆被赋予蓝色四方形类。
在这里插入图片描述
由此也说明了KNN算法的结果很大程度取决于K的选择。
在KNN中，通过计算对象间距离来作为各个对象之间的非相似性指标，避免了对象之间的匹配问题，在这里距离一般使用欧氏距离或曼哈顿距离：

同时，KNN通过依据k个对象中占优的类别进行决策，而不是单一的对象类别决策。这两点就是KNN算法的优势。
接下来对KNN算法的思想总结一下：就是在训练集中数据和标签已知的情况下，输入测试数据，将测试数据的特征与训练集中对应的特征进行相互比较，找到训练集中与之最为相似的前K个数据，则该测试数据对应的类别就是K个数据中出现次数最多的那个分类，其算法的描述为：
1）计算测试数据与各个训练数据之间的距离；

2）按照距离的递增关系进行排序；

3）选取距离最小的K个点；

4）确定前K个点所在类别的出现频率；

5）返回前K个点中出现频率最高的类别作为测试数据的预测分类。

二 .python实现

首先呢，需要说明的是我用的是python3.7.9，里面有一些用法与2.7还是有些出入。

建立一个KNN.py文件对算法的可行性进行验证，如下：

# coding:utf-8

from numpy import *

'''
numpy.tile(A,B)
>>> import numpy
>>> numpy.tile([0,0],5)#在列方向上重复[0,0]5列，默认行1次
array([0, 0, 0, 0, 0, 0, 0, 0, 0, 0])

numpy.tile([0,0],(2,1))#在列方向上重复[0,0]1次，行2次
array([[0, 0],
       [0, 0]])
>>> numpy.tile([0,0],(1,3))#在列方向上重复[0,0]3次，行1次
array([[0, 0, 0, 0, 0, 0]])
>>> numpy.tile(0,(5,2))
array([[0, 0],
       [0, 0],
       [0, 0],
       [0, 0],
       [0, 0]])
          
'''

'''
a = np.array([[1,2],[3,4]])

按行相加，不保持其二维特性
print(np.sum(a, axis=1))
# 按行相加，并且保持其二维特性
print(np.sum(a, axis=1, keepdims=True))

array([3, 7])
array([[3], [7]])
'''


# 给出训练数据以及对应的类别
def createDataSet():
    group = array([[1.0, 2.0], [1.2, 0.1], [0.1, 1.4], [0.3, 3.5]])
    labels = ['A', 'B', 'C', 'D']
    return group, labels


# 通过KNN进行分类
def classify(input, dataSet, label, k):
    dataSize = dataSet.shape[0]
    # 计算欧式距离
    diff = tile(input, (dataSize, 1)) - dataSet
    sqdiff = diff ** 2  # 表示diff的2次方
    squareDist = sum(sqdiff, axis=1)  # 行向量分别相加，从而得到新的一个行向量
    dist = squareDist ** 0.5
    print('欧式距离是：', dist)

    # 对距离进行排序,以方便查找训练集中与之最为相似的前K个数据，
    # 则该测试数据对应的类别就是K个数据中出现次数最多的那个分类
    sortedDistIndex = argsort(dist)  # argsort()根据元素的值从小到大对元素进行排序，返回下标

    classCount = {}
    for i in range(k):
        voteLabel = label[sortedDistIndex[i]]
        # 对选取的K个样本所属的类别个数进行统计
        classCount[voteLabel] = classCount.get(voteLabel, 0) + 1

        # 选取出现的类别次数最多的类别
        maxCount = 0
        for key, value in classCount.items():
            if value > maxCount:
                maxCount = value
                classes = key
        return classes


if __name__ == '__main__':
    dataSet, labels = createDataSet()
    input = array([1.2, 8])
    output = classify(input, dataSet, labels, 3)
    print("测试数据为:", input, "分类结果为：", output)