AGNES层次聚类方法

Yeahhh！

已于 2024-05-17 17:07:14 修改

阅读量1k

点赞数 28

分类专栏：机器学习文章标签：机器学习聚类人工智能

于 2024-04-09 21:50:18 首次发布

本文链接：https://blog.csdn.net/qq_62767376/article/details/137569052

版权

机器学习专栏收录该内容

16 篇文章 1 订阅

订阅专栏

第1关：距离的计算

任务描述

本关任务：根据本关所学知识，完成calc_min_dist函数，calc_max_dist函数以及calc_avg_dist函数分别实现计算两个簇之间的最短距离、最远距离和平均距离。

编程要求

根据提示，在右侧Begin-End区域补充代码，完成clac_min_dist函数，calc_max_dist函数以及calc_avg_dist函数分别实现计算两个簇之间的最短距离、最远距离和平均距离。注意：距离请使用欧氏距离。

calc_min_dist函数中的参数:

cluster1：簇1中的样本数据，类型为ndarray
cluster2：簇2中的样本数据，类型为ndarray

calc_max_dist函数中的参数:

cluster1：簇1中的样本数据，类型为ndarray
cluster2：簇2中的样本数据，类型为ndarray

calc_avg_dist函数中的参数:

cluster1：簇1中的样本数据，类型为ndarray
cluster2：簇2中的样本数据，类型为ndarray

测试说明

只需完成clac_min_dist函数，calc_max_dist函数以及calc_avg_dist函数即可，平台会对你编写的代码进行测试，并会按顺序打印最小距离、最大距离与平均距离。以下为其中一个测试用例，其中cluster1部分表示属于簇1的样本数据，cluster2部分表示属于簇2的样本数据：

测试输入： {'cluster1':[[0, 1, 0], [1, 0, 1], [1, 2, 3.2], [0, 0, 1.2], [1, 1, 0.1]], 'cluster2':[[10.1, 20.3, 9], [8.2, 15.3, 11]]}

预期输出： 17.016756, 23.977906, 21.133420

import numpy as np


def calc_min_dist(cluster1, cluster2):
    '''
    计算簇间最小距离
    :param cluster1:簇1中的样本数据，类型为ndarray
    :param cluster2:簇2中的样本数据，类型为ndarray
    :return:簇1与簇2之间的最小距离
    '''

    #********* Begin *********#
    min_dist = float('inf')
    for i in range(len(cluster1)):
        for j in range(len(cluster2)):
            dist = np.sqrt(np.sum((cluster1[i]-cluster2[j])**2))
            if dist < min_dist:
                min_dist = dist
    return min_dist
    #********* End *********#


def calc_max_dist(cluster1, cluster2):
    '''
    计算簇间最大距离
    :param cluster1:簇1中的样本数据，类型为ndarray
    :param cluster2:簇2中的样本数据，类型为ndarray
    :return:簇1与簇2之间的最大距离
    '''

    #********* Begin *********#
    max_dist = 0
    for i in range(len(cluster1)):
        for j in range(len(cluster2)):
            dist = np.sqrt(np.sum((cluster1[i]-cluster2[j])**2))
            if dist > max_dist:
                max_dist = dist
    return max_dist
    #********* End *********#


def calc_avg_dist(cluster1, cluster2):
    '''
    计算簇间平均距离
    :param cluster1:簇1中的样本数据，类型为ndarray
    :param cluster2:簇2中的样本数据，类型为ndarray
    :return:簇1与簇2之间的平均距离
    '''

    #********* Begin *********#
    avg_dist = 0
    count = 0
    for i in range(len(cluster1)):
        for j in range(len(cluster2)):
            dist = np.sqrt(np.sum((cluster1[i]-cluster2[j])**2))
            avg_dist += dist
            count += 1
    avg_dist /= count
    return avg_dist
    #********* End *********#

第2关：AGNES算法流程

任务描述

本关任务：补充python代码，完成AGNES函数完成聚类功能。

编号	体积	重量
1	1.2	2.3
2	3.6	7.1
3	1.1	2.2
4	3.5	6.9
5	1.5	2.5

编程要求

在Begin-End区域完成AGNES函数实现聚类功能，并将聚类结果返回(量化距离时请使用簇间最大欧氏距离)。PS:假设数据集为[[1, 2], [10, 11], [1, 3]]，那么聚类结果可能为[[[1, 2], [1, 3]], [[10, 11]]]

其中：

feature：数据集，类型为ndarray
k：表示想要将数据聚成k类，类型为int

测试说明

只需完成AGNES函数即可，程序内部会调用您所完成的AGNES函数对数据进行聚类，若聚类后的簇与真实结果相似度高于0.8视为过关。

import numpy as np
def AGNES(feature, k):
    '''
    AGNES聚类并返回聚类结果
    假设数据集为`[1, 2], [10, 11], [1, 3]]，那么聚类结果可能为`[[1, 2], [1, 3]], [[10, 11]]]
    :param feature:训练数据集所有特征组成的ndarray
    :param k:表示想要将数据聚成`k`类，类型为`int`
    :return:聚类结果
    '''
    #********* Begin *********#
    # 找到距离最小的下标
    def find_Min(M):
        min = np.inf
        x = 0;
        y = 0
        for i in range(len(M)):
            for j in range(len(M[i])):
                if i != j and M[i][j] < min:
                    min = M[i][j];
                    x = i;
                    y = j
        return (x, y, min)
    #计算簇间最大距离
    def calc_max_dist(cluster1, cluster2):
        max_dist = 0
        for i in range(len(cluster1)):
            for j in range(len(cluster2)):
                dist = np.sqrt(np.sum(np.square(cluster1[i] - cluster2[j])))
                if dist > max_dist:
                    max_dist = dist
        return max_dist
    #初始化C和M
    C = []
    M = []
    for i in feature:
        Ci = []
        Ci.append(i)
        C.append(Ci)
    for i in C:
        Mi = []
        for j in C:
            Mi.append(calc_max_dist(i, j))
        M.append(Mi)
    q = len(feature)
    #合并更新
    while q > k:
        x, y, min = find_Min(M)
        C[x].extend(C[y])
        C.pop(y)
        M = []
        for i in C:
            Mi = []
            for j in C:
                Mi.append(calc_max_dist(i, j))
            M.append(Mi)
        q -= 1
    return C
    #********* End *********#

第3关：红酒聚类

任务描述

本关任务：sklearn中的AgglomerativeClustering类实现了AGNES算法，本关你需要使用 sklearn 中AgglomerativeClustering来对红酒数据进行聚类。

编程要求

在Begin-End区域填写Agglomerative_cluster(data)函数完成红酒数据聚类任务，簇的数量为3。其中：

data：数据样本，类型为ndarray，shape=[样本数量, 特征数量]
return: 聚类结果，类型为ndarray

注意：直接使用原始数据进行聚类的效果可能不太理想，你可能需要对数据进行预处理。

提示：AGNES算法需要计算距离，想想什么样的预处理方式对依赖距离的算法有好的效果。

测试说明

只需返回聚类结果即可，程序内部会检测您的代码，吻合度高于0.9视为过关。

#encoding=utf8
from sklearn.cluster import AgglomerativeClustering
 
def Agglomerative_cluster(data):
    '''
    对红酒数据进行聚类
    :param data: 数据集，类型为ndarray
    :return: 聚类结果，类型为ndarray
    '''
 
    #********* Begin *********#
    from sklearn.preprocessing import StandardScaler
    scaler = StandardScaler()
    data = scaler.fit_transform(data)
    agnes = AgglomerativeClustering(n_clusters=3)
    result = agnes.fit_predict(data)
    return result
 
    #********* End *********#

Yeahhh！

关注

28
点赞
踩
28

收藏

觉得还不错? 一键收藏
0
评论
AGNES层次聚类方法

本关任务：根据本关所学知识，完成函数，函数以及函数分别实现计算两个簇之间的最短距离、最远距离和平均距离。为了完成本关任务，你需要掌握：算法是一种自底向上聚合的层次聚类算法，它先会将数据集中的每个样本看作一个初始簇，然后在算法运行的每一步中找出距离最近的两个簇进行合并，直至达到预设的簇的数量。所以算法需要不断的计算簇之间的距离，这也符合聚类的核心思想（物以类聚，人以群分），因此怎样度量两个簇之间的距离成为了关键。衡量两个簇之间的距离通常分为最小距离、最大距离和平均距离。在算法中可根据具体业务选择其中一种距离作
复制链接

扫一扫