Peter Harrington,Machine Learning in Action,第二章kNN 算法错误,2.2.1 Prepare: parsing data from a text file

《机器学习实战》-哈林顿 (Peter Harrington)-实战源代码

第二章,kNN 算法错误,2.2.1 Prepare: parsing data from a text file

def file2matrix(filename):
    fr = open(filename)
    numberOfLines = len(fr.readlines()) 
    returnMat = zeros((numberOfLines,3)) 
    classLabelVector = []
    fr = open(filename)
    index = 0
    for line in fr.readlines():
        line = line.strip()
        listFromLine = line.split('\t') 
        returnMat[index,:] = listFromLine[0:3] 
        classLabelVector.append(int(listFromLine[-1])) 
        index += 1
    return returnMat,classLabelVector

由于配套的文件datingTestSet.txt第四列为文本字串,故代码中标红的int类型,在python3中调试时会报错,应当改为str。但如果修改成str后,又面临最后一列是数字时不能识别的问题,所以应该基于判断listFromLine[-1])是数字还是字母,然后有选择性地进行类型转换,代码修改后如下所示:

def file2matrix(filename):
    fr = open(filename)
    numberOfLines = len(fr.readlines()) 
    returnMat = zeros((numberOfLines,3)) 
    classLabelVector = []
    fr = open(filename)
    index = 0
    for line in fr.readlines():
        line = line.strip()
        listFromLine = line.split('\t') 
        returnMat[index,:] = listFromLine[0:3]
        if listFromLine[-1].isdigit():
             classLabelVector.append(int(listFromLine[-1])) 
        elif listFromLine[-1].isalpha():
             classLabelVector.append(str(listFromLine[-1])) 

        index += 1
    return returnMat,classLabelVector

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值