《昇思25天学习打卡营第25天|K近邻算法实现红酒聚类》

最新推荐文章于 2024-07-25 22:24:14 发布

xwang-0415

最新推荐文章于 2024-07-25 22:24:14 发布

阅读量920

点赞数 28

分类专栏：昇思25天学习打卡营文章标签：学习近邻算法聚类数据挖掘

本文链接：https://blog.csdn.net/weixin_49123292/article/details/140502152

版权

昇思25天学习打卡营专栏收录该内容

25 篇文章 0 订阅

订阅专栏

#学习打卡第25天#

1. K近邻算法

K近邻算法（K-Nearest-Neighbor, KNN）是一种用于分类和回归的非参数统计方法，最初由 Cover和Hart于1968年提出(Cover等人,1967)，是机器学习最基础的算法之一。它正是基于以上思想：要确定一个样本的类别，可以计算它与所有训练样本的距离，然后找出和该样本最接近的k个样本，统计出这些样本的类别并进行投票，票数最多的那个类就是分类的结果。KNN的三个基本要素：

K值，一个样本的分类是由K个邻居的“多数表决”确定的。K值越小，容易受噪声影响，反之，会使类别之间的界限变得模糊。
距离度量，反映了特征空间中两个样本间的相似度，距离越小，越相似。常用的有Lp距离（p=2时，即为欧式距离）、曼哈顿距离、海明距离等。
分类决策规则，通常是多数表决，或者基于距离加权的多数表决（权值与距离成反比）。

1.1 分类问题

预测算法（分类）的流程如下：

（1）在训练样本集中找出距离待测样本x_test最近的k个样本，并保存至集合N中；

（2）统计集合N中每一类样本的个数𝐶𝑖,𝑖=1,2,3,...,𝑐𝐶𝑖,𝑖=1,2,3,...,𝑐；

（3）最终的分类结果为argmax𝐶𝑖𝐶𝑖 （最大的对应的𝐶𝑖𝐶𝑖）那个类。

在上述实现过程中，k的取值尤为重要。它可以根据问题和数据特点来确定。在具体实现时，可以考虑样本的权重，即每个样本有不同的投票权重，这种方法称为带权重的k近邻算法，它是一种变种的k近邻算法。

1.2 回归问题

假设离测试样本最近的k个训练样本的标签值为𝑦𝑖𝑦𝑖，则对样本的回归预测输出值为：

带样本权重的回归预测函数为，其中𝑤𝑖𝑤𝑖为第个𝑖𝑖样本的权重：

1.3 距离的定义

KNN算法的实现依赖于样本之间的距离，其中最常用的距离函数就是欧氏距离（欧几里得距离）：

需要特别注意的是，使用欧氏距离时，应将特征向量的每个分量归一化，以减少因为特征值的尺度范围不同所带来的干扰，否则数值小的特征分量会被数值大的特征分量淹没。

其它的距离计算方式还有Mahalanobis距离、Bhattacharyya距离等。

2. 数据处理

2.1 数据准备

Wine数据集是模式识别最著名的数据集之一，Wine数据集的官网：Wine Data Set。这些数据是对来自意大利同一地区但来自三个不同品种的葡萄酒进行化学分析的结果。数据集分析了三种葡萄酒中每种所含13种成分的量。这些13种属性是：

Alcohol，酒精
Malic acid，苹果酸
Ash，灰
Alcalinity of ash，灰的碱度
Magnesium，镁
Total phenols，总酚
Flavanoids，类黄酮
Nonflavanoid phenols，非黄酮酚
Proanthocyanins，原花青素
Color intensity，色彩强度
Hue，色调
OD280/OD315 of diluted wines，稀释酒的OD280/OD315
Proline，脯氨酸

有两个获取数据的方式：

方式一，从Wine数据集官网下载wine.data文件
方式二，从华为云OBS中下载wine.data文件

from download import download

# 下载红酒数据集
url = "https://ascend-professional-construction-dataset.obs.cn-north-4.myhuaweicloud.com:443/MachineLearning/wine.zip"  
path = download(url, "./", kind="zip", replace=True)

2.2 数据读取与处理

读取Wine数据集wine.data，并查看部分数据

import os
import csv
import numpy as np
import matplotlib.pyplot as plt

import mindspore as ms
from mindspore import nn, ops

ms.set_context(device_target="CPU")

with open('wine.data') as csv_file:
    data = list(csv.reader(csv_file, delimiter=','))
print(data[56:62]+data[130:133])
print("data numL: ", len(data))


# 取三类样本（共178条），将数据集的13个属性作为自变量𝑋，将数据集的3个类别作为因变量𝑌
X = np.array([[float(x) for x in s[1:]] for s in data[:178]], np.float32)
Y = np.array([s[0] for s in data[:178]], np.int32)

# 将数据集按128:50划分为训练集（已知类别样本）和验证集（待验证样本）
train_idx = np.random.choice(178, 128, replace=False)
test_idx = np.array(list(set(range(178)) - set(train_idx)))
X_train, Y_train = X[train_idx], Y[train_idx]
X_test, Y_test = X[test_idx], Y[test_idx]

3. 模型构建

利用MindSpore提供的tile, square, ReduceSum, sqrt, TopK等算子，通过矩阵运算的方式同时计算输入样本x和已明确分类的其他样本X_train的距离，并计算出top k近邻。

class KnnNet(nn.Cell):
    def __init__(self, k):
        super(KnnNet, self).__init__()
        self.k = k

    def construct(self, x, X_train):
        #平铺输入x以匹配X_train中的样本数
        x_tile = ops.tile(x, (128, 1))
        square_diff = ops.square(x_tile - X_train)
        square_dist = ops.sum(square_diff, 1)
        dist = ops.sqrt(square_dist)
        #-dist表示值越大，样本就越接近
        values, indices = ops.topk(-dist, self.k)
        return indices

def knn(knn_net, x, X_train, Y_train):
    x, X_train = ms.Tensor(x), ms.Tensor(X_train)
    indices = knn_net(x, X_train)
    topk_cls = [0]*len(indices.asnumpy())
    for idx in indices.asnumpy():
        topk_cls[Y_train[idx]] += 1
    cls = np.argmax(topk_cls)
    return cls

4. 模型预测

train_idx = np.random.choice(178, 128, replace=False)
test_idx = np.array(list(set(range(178)) - set(train_idx)))
X_train, Y_train = X[train_idx], Y[train_idx]
X_test, Y_test = X[test_idx], Y[test_idx]

acc = 0
knn_net = KnnNet(5)
for x, y in zip(X_test, Y_test):
    pred = knn(knn_net, x, X_train, Y_train)
    acc += (pred == y)
    # print('label: %d, prediction: %s' % (y, pred))
print('Validation accuracy is %f' % (acc/len(Y_test)))

5. 心得总结

此次学习是使用MindSpore实现了KNN算法，用来解决3分类问题。取wine数据集上的3类样本，分为已知类别样本和待验证样本，从最终实验结果验证KNN算法的有效性，在取𝑘=5，验证精度达到了78%，说明KNN算法在该3分类任务上有效，能根据酒的13种属性判断出酒的品种。

KNN算法通过计算样本间的距离进行分类，适用于多类别数据。其优点是简单直观，无需训练过程；但缺点是计算量大，对噪声敏感。在实际应用中，选择合适的距离度量和K值是关键。

xwang-0415

关注

28
点赞
踩
25

收藏

觉得还不错? 一键收藏
0
评论
《昇思25天学习打卡营第25天|K近邻算法实现红酒聚类》

KNN算法通过计算样本间的距离进行分类，适用于多类别数据。其优点是简单直观，无需训练过程；但缺点是计算量大，对噪声敏感。在实际应用中，选择合适的距离度量和K值是关键。
复制链接

扫一扫