python实现样本集划分---kennard-stone算法，T-SNE对所选样本集的绘制-CSDN博客

本文链接：https://blog.csdn.net/qq_38679413/article/details/108140969

一、Kennard-Stone算法原理

Kennard-Stone算法原理：把所有的样本都看作训练集候选样本,依次从中挑选样本进训练集。首先选择欧氏距离最远的两个样本进入训练集，其后通过计算剩下的每一个样品到训练集内每一个已知样品的欧式距离，找到距已选样本最远以及最近的两个样本，并将这两个样本选入训练集，重复上述步骤直到样本数量达到要求。

二、Kennard-Stone算法作用

Kennard-Stone算法作用：用于数据集的划分，使用算法，将输入的数据集划分为训练集、测试集，并同时输出训练集和测试集在原样本集中的编号信息，方便样本的查找。

三、参考链接

https://blog.csdn.net/joseph__lagrange/article/details/95042656

https://github.com/hkaneko1985/kennardstonealgorithm

https://blog.csdn.net/tszupup/article/details/84997804

四、代码实现

kennardstonealgorithm.py

kennardstonealgorithm函数中，输入x_variables为样本集（二维numpy），k为挑选的train训练集的个数；输出为划分的训练集和测试集在原样本中的编号数组。

# select samples using Kennard-Stone algorithm
import numpy as np

# --- input ---
# X : dataset of X-variables (samples x variables)
# k : number of samples to be selected
#
# --- output ---
# selected_sample_numbers : selected sample numbers (training data)
# remaining_sample_numbers : remaining sample numbers (test data)

def kennardstonealgorithm(x_variables, k):
    x_variables = np.array(x_variables)
    original_x = x_variables
    distance_to_average = ((x_variables - np.tile(x_variables.mean(axis=0), (x_variables.shape[0], 1))) ** 2).sum(axis=1)
    max_distance_sample_number = np.where(distance_to_average == np.max(distance_to_average))
    max_distance_sample_number = max_distance_sample_number[0][0]
    selected_sample_numbers = list()
    selected_sample_numbers.append(max_distance_sample_number)
    remaining_sample_numbers = np.arange(0, x_variables.shape[0], 1)
    x_variables = np.delete(x_variables, selected_sample_numbers, 0)
    remaining_sample_numbers = np.delete(remaining_sample_numbers, selected_sample_numbers, 0)
    for iteration in range(1, k):
        selected_samples = original_x[selected_sample_numbers, :]
        min_distance_to_selected_samples = list()
        for min_distance_calculation_number in range(0, x_variables.shape[0]):
            distance_to_selected_samples = ((selected_samples - np.tile(x_variables[min_distance_calculation_number, :],
                                                                        (selected_samples.shape[0], 1))) ** 2).sum(axis=1)
            min_distance_to_selected_samples.append(np.min(distance_to_selected_samples))
        max_distance_sample_number = np.where(
            min_distance_to_selected_samples == np.max(min_distance_to_selected_samples))
        max_distance_sample_number = max_distance_sample_number[0][0]
        selected_sample_numbers.append(remaining_sample_numbers[max_distance_sample_number])
        x_variables = np.delete(x_variables, max_distance_sample_number, 0)
        remaining_sample_numbers = np.delete(remaining_sample_numbers, max_distance_sample_number, 0)

    return selected_sample_numbers, remaining_sample_numbers

kennard-stone.py

对选出来的train样本使用T-SNE算法进行绘制，作者对从MNIST测试集中提取的2000个特征样本中选取了1800个进行划分，并使用T-SNE绘制其分布。

# -*- coding: utf-8 -*- %reset -f
import matplotlib.pyplot as plt
import numpy as np
import kennardstonealgorithm
from sklearn.manifold import TSNE

# 对样本进行预处理并画图
def plot_embedding(data, title):
	"""
	:param data:数据集
	:param label:样本标签
	:param title:图像标题
	:return:图像
	"""
	x_min, x_max = np.min(data, 0), np.max(data, 0)
	data = (data - x_min) / (x_max - x_min)		# 对数据进行归一化处理
	fig = plt.figure()		# 创建图形实例
	ax = plt.subplot(111)		# 创建子图
	# 遍历所有样本
	for i in range(data.shape[0]):
		# 在图中为每个数据点画出标签
		plt.text(data[i, 0], data[i, 1], str(0), color=plt.cm.Set1(0 / 10),
				 fontdict={'weight': 'bold', 'size': 7})
	plt.xticks()		# 指定坐标的刻度
	plt.yticks()
	plt.title(title, fontsize=14)
	# 返回值
	return fig

number_of_selected_samples = 1800
data = np.load('fea_array.npy')
idxs_selected_sample, idxs_remaining_sample = kennardstonealgorithm.kennardstonealgorithm(
    data, number_of_selected_samples)

data_slt = data[idxs_selected_sample, :]
tsne = TSNE(n_components=2, init='pca', random_state=0)
reslut = tsne.fit_transform(data_slt)

fig = plot_embedding(reslut, 't-SNE Embedding of digits')
plt.show()