机器学习分类算法—knn-（动作片or爱情片）

最新推荐文章于 2023-06-12 15:47:45 发布

kingsure001

最新推荐文章于 2023-06-12 15:47:45 发布

阅读量1.3k

点赞数 1

分类专栏：机器学习文章标签：机器学习

本文链接：https://blog.csdn.net/kingsure001/article/details/107483571

版权

机器学习专栏收录该内容

22 篇文章 4 订阅

订阅专栏

本题：根据接吻次数和打斗次数来判断电影的类型
k-近邻算法步骤如下

计算已知类别数据集中的点与当前点之间的距离；

在这里插入图片描述
按照距离递增次序排序；
选取与当前点距离最小的k个点；
确定前k个点所在类别的出现频率；
返回前k个点所出现频率最高的类别作为当前点的预测分类。

import numpy as np
import operator
"""
函数说明:创建数据集
Parameters:
	无
Returns:
	group - 数据集
	labels - 分类标签
Modify:
	2017-07-13
"""
def createDataSet():
	#四组二维特征
	group = np.array([[1,101],[5,89],[108,5],[115,8]])
	#四组特征的标签
	labels = ['爱情片','爱情片','动作片','动作片']
	return group, labels

"""
函数说明:kNN算法,分类器

Parameters:
	inX - 用于分类的数据(测试集)
	dataSet - 用于训练的数据(训练集)
	labes - 分类标签
	k - kNN算法参数,选择距离最小的k个点
Returns:
	sortedClassCount[0][0] - 分类结果

Modify:
	2017-07-13
"""
def classify0(inX, dataSet, labels, k):
	#计算出距离,np.sum(a,axis = 0)
    #axis为0是压缩行,即将每一列的元素相加,将矩阵压缩为一行
    #np.sum(a,axis = 1)
    #axis为1是压缩列,即将每一行的元素相加,将矩阵压缩为一列
	distances = np.sum((inX - dataSet)**2, axis=1)**0.5
	#返回distances中元素从小到大排序后的索引值,argsort()函数返回索引值
	sortedDistIndices = distances.argsort()
	#定一个记录类别次数的字典
	classCount = {}
	for i in range(k):
		#取出前k个元素的类别，根据索引值到标签中去寻找“爱情片or动作片”
		voteIlabel = labels[sortedDistIndices[i]]
		#dict.get(key,default=None),字典的get()方法,返回指定键的值,如果值不在字典中返回默认值。
		#计算类别次数
		classCount[voteIlabel] = classCount.get(voteIlabel,0) + 1
	#python3中用items()替换python2中的iteritems()
	#key=operator.itemgetter(1)根据字典的值进行排序
	#key=operator.itemgetter(0)根据字典的键进行排序
	#reverse降序排序字典
	sortedClassCount = sorted(classCount.items(),key=operator.itemgetter(1),reverse=True)
	#返回次数最多的类别,即所要分类的类别
	return sortedClassCount[0][0]

if __name__ == '__main__':
    #if __name__ == '__main__'的意思是：
    # 当.py文件被直接运行时，if __name__ == '__main__'之下的代码块将被运行；
    # 当.py文件以模块形式被导入时，if __name__ == '__main__'之下的代码块不被运行。
	#创建数据集
	group, labels = createDataSet()
	#测试集
	test = [101,20]
	#kNN分类
	test_class = classify0(test, group, labels, 3)
	#打印分类结果
	print(test_class)