numpy KNN简单实现

numpy支持矩阵减向量(每行减去某个向量) 列的情况可以考虑转置。

R实现:
library(class)
attach(iris)
train <- iris[,1:2]
y <- as.numeric(Species)
x <- train
fit <- knn(x, x, y)
print(1 - sum(fit==y)/length(y))

利用ndarray的诸多特性,可以实现非常简短的(DIY)KNN:
import numpy as np 
from sklearn.datasets import load_iris
iris = load_iris()
#print iris.DESCR
X = iris.data[:,1:3]
y = iris.target 

def predict_y(x, k = 1):
 distance_array = np.linalg.norm(X - x, axis = 1)
 # the increase distance indexs
 distance_indexs = np.argsort(distance_array)[1:k + 1]
 y_unique_counts = np.unique(y[distance_indexs], return_counts = True)

 return y_unique_counts[0][np.argmax(y_unique_counts[1])]

predict = map(predict_y, X)
error_num = 0
for i in range(len(predict)):
 if predict[i] != y[i]:
  error_num += 1

print "error_error :"
print float(error_num) / len(predict)



  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
KNN(K-Nearest Neighbors)是一种基本的分类和回归算法,其中KNN分类算法根据K个最近邻居的标签来预测新数据点的标签。在这里,我们将使用numpy实现KNN算法来分类鸢尾花数据集。 首先,我们需要加载鸢尾花数据集,可以使用sklearn库中的load_iris()函数来加载数据集。代码如下: ```python from sklearn.datasets import load_iris iris = load_iris() X = iris.data y = iris.target ``` 然后,我们需要将数据集分为训练数据和测试数据,通常将数据集的70%用于训练,30%用于测试。我们可以使用sklearn库中的train_test_split()函数来实现。代码如下: ```python from sklearn.model_selection import train_test_split X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42) ``` 接下来,我们需要计算测试数据集中每个数据点与训练数据集中每个数据点之间的距离。我们可以使用欧几里得距离公式来计算数据点之间的距离。代码如下: ```python import numpy as np def euclidean_distance(x1, x2): return np.sqrt(np.sum((x1 - x2)**2)) class KNN: def __init__(self, k=3): self.k = k def fit(self, X, y): self.X_train = X self.y_train = y def predict(self, X): y_pred = [self._predict(x) for x in X] return np.array(y_pred) def _predict(self, x): distances = [euclidean_distance(x, x_train) for x_train in self.X_train] k_idx = np.argsort(distances)[:self.k] k_neighbor_labels = [self.y_train[i] for i in k_idx] most_common = Counter(k_neighbor_labels).most_common(1) return most_common[0][0] ``` 在KNN类中,我们定义了fit()函数来训练模型,predict()函数来预测测试数据集中的标签,_predict()函数来计算每个测试数据点的标签。在_predict()函数中,我们计算测试数据点与每个训练数据点之间的距离,选择k个最近邻居,并使用Counter函数来计算最常见的标签并进行预测。 最后,我们可以使用以上定义的KNN类来预测测试数据集中的标签。代码如下: ```python from collections import Counter k = 3 clf = KNN(k=k) clf.fit(X_train, y_train) y_pred = clf.predict(X_test) accuracy = np.sum(y_pred == y_test) / len(y_test) print("Accuracy:", accuracy) ``` 输出结果为: ``` Accuracy: 1.0 ``` 这意味着我们的模型在测试数据集中的所有数据点上都有100%的准确率。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值