本文学习资源来自《Python数据挖掘入门与实践》中国工信出版集团 人民邮电出版社
亲和度
亲和度是用来表示一个实体与其他实体之间的亲和程度。
假设有两个实体E1和E2,如果他们从来没有被相同的活动使用,则他们的亲和度E(E1,E2)=0;如果他们总是同时被每一个活动所使用,则他们的亲和度E(E1,E2)=1。如果仅被某些活动一起使用,则其亲和度E(E1,E2)在(0,1)的区间内。
——百度百科
典型的应用场景:
购买一种商品的顾客可能要购买另一些商品
为网站用户提供服务推荐或定向广告
根据基因寻找有亲缘关系的人
亲和性有多种测量方法,如:
统计两件端口一起出售的频率,或者统计顾客购买了商品1后再买商品2的比率。
示例
运行环境:IPython notebook
数据 affinity_dataset.txt
数据示例
0 0 1 1 1
1 1 0 1 0
1 0 1 1 0
0 0 1 1 1
0 1 0 0 1
0 1 0 0 0
加载数据
import numpy as np
dataset_filename = "affinity_dataset.txt"
X = np.loadtxt(dataset_filename)
n_samples, n_features = X.shape
print("This dataset has {0} samples and {1}