机器学习实战-kNN章节

这是第一章的内容

我基本会每天不断的学习和更新,希望大家能够和我讨论,指出我的不足和问题。本章内容主要是说用kNN去做判断。kNN是计算训练样本和测试样本相同属性之间的值的欧几里得距离的远近,从而判断应给该测试样本什么标签。代码中涉及基本的读入数据,转换数据成numpy格式,算法判断。都是很基本的。

from numpy import *
import operator

def createDataSet():   #数据和标签分开存入,次序相同。
    group = array([[1.0,1.1],[1.0,1.0],[0.0],[0,0.1]])
    labels = ['A','A','B','B']
    return group, labels

def file2matic(filename):
    fileinput = open(filename)
    arrayOflines = fileinput.readlines()  #.read返回string,.readline()返回list
    numberOfLines = len(arrayOflines)   #求list长度,不能用shape
    returnMat = zeros((numberOfLines,3))  #创建numpy格式的全部为0的,和预存入数据相同m*n的matrics。
    index = 0  #记录在循环中所读取的当前行数
    LineLabels = []    #设置初始值
    for line in arrayOflines:
        line = line.strip()   #去掉每行的空字符
        ListFromLine = line.split('\t')  #以tab键为分隔符分割list
        returnMat[index,:] = ListFromLine[0:3]  #当读到第一行时(index=1),把第一行的输入数据分配到空字符中,取代0 
        LineLabels.append(int(ListFromLine[-1]))  #存取对应的标签,把string转换成int
        index += 1
    return returnMat, LineLabels

def autonorm(dataSet):
    # 获得数据的最小值
    minVals = dataSet.min(0)
    maxVals = dataSet.max(0)
    # 最大值和最小值的范围
    ranges = maxVals - minVals
    # shape(dataSet)返回dataSet的矩阵行列数
    normDataSet = zeros(shape(dataSet))
    # 返回dataSet的行数
    m = dataSet.shape[0]
    # 原始值减去最小值
    normDataSet = dataSet - tile(minVals, (m, 1))
    # 除以最大和最小值的差,得到归一化数据
    normDataSet = normDataSet / tile(ranges, (m, 1))
    # 返回归一化数据结果,数据范围,最小值
    return normDataSet, ranges, minVals

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值