K-近邻算法（KNN）

心刍

已于 2023-08-01 20:31:26 修改

阅读量70

点赞数 4

分类专栏：大数据智能文章标签：近邻算法算法机器学习分类算法分类

于 2023-05-26 17:57:10 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/xinchu0309/article/details/130867269

版权

大数据智能专栏收录该内容

1 篇文章 0 订阅

订阅专栏

目录

一个简单的分类器

示例：使用k-近邻算法改进约会网站的配对效果

（1）收集数据

（2）准备数据：用python解析，归一化数值

（3）分析数据：使用Matplotlib创建散点图

（4）训练算法（此步骤不适合k-近邻算法）

（5）测试算法

（6）使用算法

使用k-邻近算法识别手写数字

概述

优点：精度高，对异常值不敏感，无数据输入假定

缺点：计算，空间，复杂度较高

适用于：数值型（连续型），标称型

简单来说：就是采用测量不同特征值之间的距离方法进行分类

一个简单的分类器

大致的作用：自己构建了四个点，为它们附上标签，让程序以这些为指标，判断不同的点应该对应A还是B

import numpy as np #相较书上的不容易出现命名错误
import operator    #运算符模块


def createDataSet(): #自己构建一个小的指标
    group = np.array([[1.0, 1.1], [1.0, 1.0], [0, 0], [0, 0.1]]) #数据集
    labels = ['A', 'A', 'B', 'B'] #数据标签
    return group, labels          #返回值

group,labels=createDataSet()

def classify0(inX, dataSet, labels, k):#(要判断的数据，原数据，原数据类型，前k个)
    dataSetSize = dataSet.shape[0] #矩阵第一维的长度
    diffMat = np.tile(inX, (dataSetSize, 1)) - dataSet #根据训练数据大小生成
    sqDiffMat = diffMat**2 #二维特征相减后平方
    sqDistances = sqDiffMat.sum(axis=1) ########沿着列（但不是很懂为啥）
    distances = sqDistances**0.5 #累加开方
    sortedDistIndicies = distances.argsort()#返回distances中元素从小到大排序后的索引值
    classCount = {} #开一个记录类别次数的字典
    for i in range(k):
        voteIlabel = labels[sortedDistIndicies[i]]
        classCount[voteIlabel] = classCount.get(voteIlabel, 0) + 1

    sortedClassCount = sorted(classCount.items(), key=operator.itemgetter(1), reverse=True) #后两个意思应该是根据第二维，降序排序
    return sortedClassCount[0][0]

a=classify0([0,0],group,labels,3)
print(a)

示例：使用k-近邻算法改进约会网站的配对效果

（1）收集数据

此处有给定的一些数据，存放在同一个文件夹下ceshi1.txt文件中

（2）准备数据：用python解析，归一化数值

import numpy as np
import operator


def file2matrix(filename):
    love_dictionary = {'largeDoses':3, 'smallDoses':2, 'didntLike':1}#字典定义三的类别
    fr = open(filename)#打开文件
    arrayOLines = fr.readlines() #逐行处理，readlines()方法用于读取所有行(直到结束符 EOF)并返回列表，该列表可以由 Python 的 for... in ... 结构进行处理。
    numberOfLines = len(arrayOLines) #算行数
    returnMat = np.zeros((numberOfLines, 3)) #初始化numpy型， numberOfLines*3大小的特征矩阵
    classLabelVector = [] #初始化标签
    index = 0   #行索引
    for line in arrayOLines:
        line = line.strip() #删空格
        listFromLine = line.split('\t') #用空格分割   成列表
        #没懂为啥是三个
        returnMat[index, :] = listFromLine[0:3]
        #如果是数字
        if(listFromLine[-1].isdigit()):
            #直接赋值到标签
            classLabelVector.append(int(listFromLine[-1]))
        else:
            #如果是字符串，用love_dictionary转换
            classLabelVector.append(love_dictionary.get(listFromLine[-1]))
        index += 1 #索引的移动
    return returnMat, classLabelVector


def autoNorm(dataSet):
    #最大最小
    minVals = dataSet.min(0)
    maxVals = dataSet.max(0)
    ranges = maxVals - minVals
    #创建全0的初始矩阵
    normDataSet = np.zeros(np.shape(dataSet))
    #行数
    m = dataSet.shape[0]
    #原始值减去最小值除以最大和最小值的差（书上归一化数据的方法）
    normDataSet = dataSet - np.tile(minVals, (m, 1))
    normDataSet = normDataSet/np.tile(ranges, (m, 1))
    return normDataSet, ranges, minVals

returnMat,classLabelVector=file2matrix('ceshi1.txt')
normDataSet,ranges,minVals=autoNorm(returnMat)

print(normDataSet)
print(ranges)
print(minVals)

（3）分析数据：使用Matplotlib创建散点图

import numpy as np
import operator
import matplotlib
import matplotlib.pyplot as plt


def file2matrix(filename):
    love_dictionary = {'largeDoses':3, 'smallDoses':2, 'didntLike':1}
    fr = open(filename)
    arrayOLines = fr.readlines()
    numberOfLines = len(arrayOLines)           
    returnMat = np.zeros((numberOfLines, 3))      
    classLabelVector = []                       
    index = 0
    for line in arrayOLines:
        line = line.strip()
        listFromLine = line.split('\t')
        returnMat[index, :] = listFromLine[0:3]
        if(listFromLine[-1].isdigit()):
            classLabelVector.append(int(listFromLine[-1]))
        else:
            classLabelVector.append(love_dictionary.get(listFromLine[-1]))
        index += 1
    return returnMat, classLabelVector
a,b=file2matrix('ceshi1.txt')

fig=plt.figure()
ax=fig.add_subplot(111)
ax.scatter(a[:,1],a[:,2],15.0*np.array(b),15.0*np.array(b))
 # 保证图片中输出的文字为中文
plt.rcParams['font.sans-serif']=['SimHei']
plt.rcParams['axes.unicode_minus'] = False
# 输出横纵坐标上的文字
plt.xlabel("玩游戏所耗时间百分比")
plt.ylabel("每周消耗的冰淇淋公升数")
plt.show()

（4）训练算法（此步骤不适合k-近邻算法）

（5）测试算法

import numpy as np
import operator
import matplotlib
import matplotlib.pyplot as plt

#读取数据
def file2matrix(filename):
    love_dictionary = {'largeDoses':3, 'smallDoses':2, 'didntLike':1}#字典定义三的类别
    fr = open(filename)#打开文件
    arrayOLines = fr.readlines() #逐行处理，readlines()方法用于读取所有行(直到结束符 EOF)并返回列表，该列表可以由 Python 的 for... in ... 结构进行处理。
    numberOfLines = len(arrayOLines) #算行数
    returnMat = np.zeros((numberOfLines, 3)) #初始化numpy型， numberOfLines*3大小的特征矩阵
    classLabelVector = [] #初始化标签
    index = 0   #行索引
    for line in arrayOLines:
        line = line.strip() #删空格
        listFromLine = line.split('\t') #用空格分割   成列表
        #没懂为啥是三个
        returnMat[index, :] = listFromLine[0:3]
        #如果是数字
        if(listFromLine[-1].isdigit()):
            #直接赋值到标签
            classLabelVector.append(int(listFromLine[-1]))
        else:
            #如果是字符串，用love_dictionary转换
            classLabelVector.append(love_dictionary.get(listFromLine[-1]))
        index += 1 #索引的移动
    return returnMat, classLabelVector

#归一化处理
def autoNorm(dataSet):
    #最大最小
    minVals = dataSet.min(0)
    maxVals = dataSet.max(0)
    ranges = maxVals - minVals
    #创建全0的初始矩阵
    normDataSet = np.zeros(np.shape(dataSet))
    #行数
    m = dataSet.shape[0]
    #原始值减去最小值除以最大和最小值的差（书上归一化数据的方法）
    normDataSet = dataSet - np.tile(minVals, (m, 1))
    normDataSet = normDataSet/np.tile(ranges, (m, 1))
    return normDataSet, ranges, minVals


def classify0(inX, dataSet, labels, k):#(要判断的数据，原数据，原数据类型，前k个)
    dataSetSize = dataSet.shape[0] #矩阵第一维的长度
    diffMat = np.tile(inX, (dataSetSize, 1)) - dataSet #根据训练数据大小生成
    sqDiffMat = diffMat**2 #二维特征相减后平方
    sqDistances = sqDiffMat.sum(axis=1) ########沿着列（但不是很懂为啥）
    distances = sqDistances**0.5 #累加开方
    sortedDistIndicies = distances.argsort()#返回distances中元素从小到大排序后的索引值
    classCount = {} #开一个记录类别次数的字典
    for i in range(k):
        voteIlabel = labels[sortedDistIndicies[i]]
        classCount[voteIlabel] = classCount.get(voteIlabel, 0) + 1
    sortedClassCount = sorted(classCount.items(), key=operator.itemgetter(1), reverse=True) #后两个意思应该是根据第二维，降序排序
    return sortedClassCount[0][0]


def datingClassTest():
    #整个数据10%来测试
    hoRatio = 0.1
    datingDataMat, datingLabels = file2matrix('ceshi1.txt')
    normMat, ranges, minVals = autoNorm(datingDataMat)
    #样本个数
    m = normMat.shape[0]
    #测试个数
    numTestVecs = int(m*hoRatio)
    #错误计数
    errorCount = 0.0
    for i in range(numTestVecs):
        #前一些为测试的，后一些用作训练
        classifierResult = classify0(normMat[i, :], normMat[numTestVecs:m, :], datingLabels[numTestVecs:m], 3)
        print("the classifier came back with: %d, the real answer is: %d" % (classifierResult, datingLabels[i]))
        if (classifierResult != datingLabels[i]): errorCount += 1.0
    print("the total error rate is: %f" % (errorCount / float(numTestVecs)))
    print(errorCount)


datingClassTest()

（6）使用算法

import numpy as np
import operator
import matplotlib
import matplotlib.pyplot as plt

#读取数据
def file2matrix(filename):
    love_dictionary = {'largeDoses':3, 'smallDoses':2, 'didntLike':1}#字典定义三的类别
    fr = open(filename)#打开文件
    arrayOLines = fr.readlines() #逐行处理，readlines()方法用于读取所有行(直到结束符 EOF)并返回列表，该列表可以由 Python 的 for... in ... 结构进行处理。
    numberOfLines = len(arrayOLines) #算行数
    returnMat = np.zeros((numberOfLines, 3)) #初始化numpy型， numberOfLines*3大小的特征矩阵
    classLabelVector = [] #初始化标签
    index = 0   #行索引
    for line in arrayOLines:
        line = line.strip() #删空格
        listFromLine = line.split('\t') #用空格分割   成列表
        #没懂为啥是三个
        returnMat[index, :] = listFromLine[0:3]
        #如果是数字
        if(listFromLine[-1].isdigit()):
            #直接赋值到标签
            classLabelVector.append(int(listFromLine[-1]))
        else:
            #如果是字符串，用love_dictionary转换
            classLabelVector.append(love_dictionary.get(listFromLine[-1]))
        index += 1 #索引的移动
    return returnMat, classLabelVector

#归一化处理
def autoNorm(dataSet):
    #最大最小
    minVals = dataSet.min(0)
    maxVals = dataSet.max(0)
    ranges = maxVals - minVals
    #创建全0的初始矩阵
    normDataSet = np.zeros(np.shape(dataSet))
    #行数
    m = dataSet.shape[0]
    #原始值减去最小值除以最大和最小值的差（书上归一化数据的方法）
    normDataSet = dataSet - np.tile(minVals, (m, 1))
    normDataSet = normDataSet/np.tile(ranges, (m, 1))
    return normDataSet, ranges, minVals


def classify0(inX, dataSet, labels, k):#(要判断的数据，原数据，原数据类型，前k个)
    dataSetSize = dataSet.shape[0] #矩阵第一维的长度
    diffMat = np.tile(inX, (dataSetSize, 1)) - dataSet #根据训练数据大小生成
    sqDiffMat = diffMat**2 #二维特征相减后平方
    sqDistances = sqDiffMat.sum(axis=1) ########沿着列（但不是很懂为啥）
    distances = sqDistances**0.5 #累加开方
    sortedDistIndicies = distances.argsort()#返回distances中元素从小到大排序后的索引值
    classCount = {} #开一个记录类别次数的字典
    for i in range(k):
        voteIlabel = labels[sortedDistIndicies[i]]
        classCount[voteIlabel] = classCount.get(voteIlabel, 0) + 1
    sortedClassCount = sorted(classCount.items(), key=operator.itemgetter(1), reverse=True) #后两个意思应该是根据第二维，降序排序
    return sortedClassCount[0][0]


def classifyPerson():
    resultList = ['not at all', 'in small doses', 'in large doses']
    percentTats = float(input(\
                                  "percentage of time spent playing video games?"))
    ffMiles = float(input("frequent flier miles earned per year?"))
    iceCream = float(input("liters of ice cream consumed per year?"))
    datingDataMat, datingLabels = file2matrix('ceshi1.txt')
    normMat, ranges, minVals = autoNorm(datingDataMat)
    inArr = np.array([ffMiles, percentTats, iceCream, ])
    classifierResult = classify0((inArr - \
                                  minVals)/ranges, normMat, datingLabels, 3)
    print("You will probably like this person: %s" % resultList[classifierResult - 1])


classifyPerson()

使用k-邻近算法识别手写数字

未完待续

关注

4
点赞
踩
2

收藏

觉得还不错? 一键收藏
打赏
1
评论
K-近邻算法（KNN）

k-近邻算法
复制链接

扫一扫

专栏目录

心刍 CSDN认证博客专家 CSDN认证企业博客

码龄2年

浙江师范大学

29: 原创

17万+: 周排名

3万+: 总排名

1万+: 访问

: 等级

694: 积分

405: 粉丝

401: 获赞

15: 评论

294: 收藏

私信

关注

热门文章

分类专栏

题解 17篇
大数据智能 1篇
python
课内 11篇

最新评论

Codeforces Round 938 (Div. 3)H-The Most Reckless Defense （状压dp）
yzzob: 博主,能不能更新下软件工程实验报告
2021江苏省赛 H-Reverse the String (哈希，二分)
普通网友: 优质好文，博主的文章细节很到位，兼顾实用性和可操作性，感谢博主的分享，文章思路清晰【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
实验二带进位控制 8位算术逻辑运算实验
CSDN-Ada助手: 恭喜作者第15篇博客！看到你进行带进位控制8位算术逻辑运算的实验，我深感你的热情和执着。不过，我想提个建议，下一步可以考虑加入一些实际案例或者应用场景，这样可以更好地帮助读者理解实验的意义和应用价值。希望你能继续保持创作热情，期待看到更多精彩的内容！
实验四移位运算器实验
CSDN-Ada助手: 恭喜您写了第16篇博客！实验四移位运算器实验听起来很有趣，我期待能够从您的博客中学到更多知识。希望您能继续保持创作的热情，也许下一步可以考虑分享一些实际运用的案例，让读者更好地理解移位运算器的应用。谢谢您的分享，期待您的下一篇博客！
实验五存储器实验
CSDN-Ada助手: 恭喜您完成第17篇博客《实验五存储器实验》！您的持续创作真令人钦佩。通过这篇博客，您向我们展示了您在存储器实验方面的深入研究和实践。我对您在这个领域的专注度感到非常震撼。在下一步的创作中，我谦虚地建议您尝试进一步探索存储器实验的相关主题。您可以考虑深入研究特定类型的存储器，或是探索存储器与其他计算机组件之间的关系。这样的探索将帮助您深化对存储器原理的理解，并为读者提供更丰富的知识。再次恭喜您的连续创作，并期待您在未来的博客中继续展示您的研究成果和创新思维！

大家在看

最新文章

目录

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

心刍 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。