这是第一章的内容
我基本会每天不断的学习和更新,希望大家能够和我讨论,指出我的不足和问题。本章内容主要是说用kNN去做判断。kNN是计算训练样本和测试样本相同属性之间的值的欧几里得距离的远近,从而判断应给该测试样本什么标签。代码中涉及基本的读入数据,转换数据成numpy格式,算法判断。都是很基本的。
from numpy import *
import operator
def createDataSet(): #数据和标签分开存入,次序相同。
group = array([[1.0,1.1],[1.0,1.0],[0.0],[0,0.1]])
labels = ['A','A','B','B']
return group, labels
def file2matic(filename):
fileinput = open(filename)
arrayOflines = fileinput.readlines() #.read返回string,.readline()返回list
numberOfLines = len(arrayOflines) #求list长度,不能用shape
returnMat = zeros((numberOfLines,3)) #创建numpy格式的全部为0的,和预存入数据相同m*n的matrics。
index = 0 #记录在循环中所读取的当前行数
LineLabels = [] #设置初始值
for line in arrayOflines:
line = line.strip() #去掉每行的空字符
ListFromLine = line.split('\t') #以tab键为分隔符分割list
returnMat[index,:] = ListFromLine[0:3] #当读到第一行时(index=1),把第一行的输入数据分配到空字符中,取代0
LineLabels.append(int(ListFromLine[-1])) #存取对应的标签,把string转换成int
index += 1
return returnMat, LineLabels
def autonorm(dataSet):
# 获得数据的最小值
minVals = dataSet.min(0)
maxVals = dataSet.max(0)
# 最大值和最小值的范围
ranges = maxVals - minVals
# shape(dataSet)返回dataSet的矩阵行列数
normDataSet = zeros(shape(dataSet))
# 返回dataSet的行数
m = dataSet.shape[0]
# 原始值减去最小值
normDataSet = dataSet - tile(minVals, (m, 1))
# 除以最大和最小值的差,得到归一化数据
normDataSet = normDataSet / tile(ranges, (m, 1))
# 返回归一化数据结果,数据范围,最小值
return normDataSet, ranges, minVals