python-常用机器学习算法-KNN

最新推荐文章于 2022-04-14 15:42:13 发布

Ftmy

最新推荐文章于 2022-04-14 15:42:13 发布

阅读量174

点赞数

分类专栏： Python

本文链接：https://blog.csdn.net/ftmy_c/article/details/85210252

版权

Python 专栏收录该内容

6 篇文章 0 订阅

订阅专栏

#knn算法核心

def knnclassify0(inX, dataSet, labels, k): #inX待分类向量 dataSet样本数据 labels标签类别 k值(前k个最近邻居)

    dataSetSize = dataSet.shape[0]

    diffMat = tile(inX, (dataSetSize,1)) - dataSet

    sqDiffMat = diffMat**2

    sqDistances = sqDiffMat.sum(axis=1)

    distances = sqDistances**0.5

    sortedDistIndicies = distances.argsort() #返回数据所在行标号，根据标号可以取到对应类别labels

    classCount={}     #classCount:{'B',3}

    for i in range(k):

        voteIlabel = labels[sortedDistIndicies[i]]

        classCount[voteIlabel] = classCount.get(voteIlabel,0) + 1

    sortedClassCount = sorted(classCount.iteritems(), key=operator.itemgetter(1), reverse=True)

    return sortedClassCount[0][0]

#数据集转换为矩阵

def file2matrix(filename):  #datingTestSet2.txt数据变为矩阵 file To matrix

    fr = open(filename)

    numberOfLines = len(fr.readlines())         #get the number of lines in the file

    returnMat = zeros((numberOfLines,3))        #prepare matrix to return  属性矩阵

    classLabelVector = []                       #prepare labels return   类别标签向量

    fr = open(filename)

    index = 0

    for line in fr.readlines():

        line = line.strip()

        listFromLine = line.split('\t')

        returnMat[index,:] = listFromLine[0:3]

        classLabelVector.append(int(listFromLine[-1]))

        index += 1

    return returnMat,classLabelVector

#数据集归一化

def autoNorm(dataSet):

    minVals = dataSet.min(0)

    maxVals = dataSet.max(0)

    ranges = maxVals - minVals

    normDataSet = zeros(shape(dataSet))

    m = dataSet.shape[0]

    normDataSet = dataSet - tile(minVals, (m,1))

    normDataSet = normDataSet/tile(ranges, (m,1))   #element wise divide

    return normDataSet, ranges, minVals

Ftmy

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python-常用机器学习算法-KNN

#knn算法核心def knnclassify0(inX, dataSet, labels, k): #inX待分类向量 dataSet样本数据 labels标签类别 k值(前k个最近邻居) dataSetSize = dataSet.shape[0] diffMat = tile(inX, (dataSetSize,1)) - dataSet sqDiffMa...
复制链接

扫一扫

专栏目录