Deep Learing之Jaccard系数

本文介绍了如何使用Jaccard系数来计算用户和物品之间的相似度,用于构建协同过滤推荐系统。通过Python实现展示了从数据处理到计算用户和物品相似度的过程,最终得出每个用户可能感兴趣的推荐物品。这种方法尤其适用于处理稀疏数据,弥补了余弦相似性在处理高稀疏度数据时的不足。
摘要由CSDN通过智能技术生成

Jaccard系数

Jaccard系数值越大,样本相似度越高。
J ( A , B ) = ∣ A ⋂ B ∣ ∣ A ∣ + ∣ B ∣ − ∣ A ⋂ B ∣ J(A,B)= \frac{|A\bigcap B|}{|A| +|B| - | A \bigcap B| } J(A,B)=A+BABAB

在这里插入图片描述

Jaccard 距离

与Jaccard 系数相关的指标叫做Jaccard 距离,用于描述集合之间的不相似度。Jaccard 距离越大,样本相似度越低。
d j ( A , B ) = 1 − ∣ A ⋂ B ∣ ∣ A ∣ + ∣ B ∣ − ∣ A ⋂ B ∣ d_{j}(A,B)= 1 - \frac{|A\bigcap B|}{|A| +|B| - | A \bigcap B| } dj(A,B)=1A+BABAB

例子

假设有6个用户,5个产品,用户可以随机购买,这里不止购买,比如收藏等行为都可以。数据记录在一张二维表中。

import pandas as pd
import numpy as np

users = [f"User{i}" for i in range(1, 6)]
items = [f"Item{i}" for i in 'ABCDE']

# 假设用户购买记录
datasets = [
    [1, 0, 1, 1, 0],
    [1, 0, 0, 1, 1],
    [1, 0, 1, 0, 0],
    [0, 1, 0, 1, 1],
    [1, 1, 1, 0, 1],
]
df = pd.DataFrame(datasets, columns=items, index=users)

       ItemA  ItemB  ItemC  ItemD  ItemE
User1      1      0      1      1      0
User2      1      0      0      1      1
User3      1      0      1      0      0
User4      0      1      0      1      1
User5      1      1      1      0      1

比如计算ItemA与ItemB之间的相似度,itemA = [1,1,1,0,1],ItemB=[0,0,0,1,1], ItemA与ItemB 相交的有1个,并集有5个,注意两个都是0的不计算,杰卡德系数 j = 1/5 = 0.2,假如 ItemA = [0,1,1,0,1],ItemB=[0,0,0,1,1],j = 1/4 = 0.25

score = jaccard_score(df['ItemA'], df['ItemB'])  # 0.2

任意两个用户之间的相似度

# 求任意两个用户之间的距离
from sklearn.metrics import pairwise_distances
# jaccard 距离
jaccard_dis = pairwise_distances(df.values, metric='jaccard')
[[0.         0.5        0.33333333 0.8        0.6       ]
 [0.5        0.         0.75       0.5        0.6       ]
 [0.33333333 0.75       0.         1.         0.5       ]
 [0.8        0.5        1.         0.         0.6       ]
 [0.6        0.6        0.5        0.6        0.        ]]

计算过程如下:

结果数组是一个5*5的二维表,数组的第一行第一列就是a[1]与a[1]之间的jaccard距离,数组的第一行第二列就是a[1]与a[2]之间的jaccard距离
a[1] = [1, 0, 1, 1, 0]
a[2] = [1, 0, 0, 1, 1]
a[3] = [1, 0, 1, 0, 0]
a[4] = [0, 1, 0, 1, 1]
a[5] = [1, 1, 1, 0, 1]
按照上面的计算方法可以计算出jaccard距离
user_sim = 1 - jaccard_dis # jaccard相似系数

# print("任意两个用户相似系数")
user_sim = pd.DataFrame(user_sim, columns=users, index=users)

任意两个物品之间的相似度

item_sim = 1 - pairwise_distances(df.T.values, metric='jaccard')
item_sim = pd.DataFrame(item_sim, columns=items, index=items)

topN

# 基于用户的协同过滤  找每一个用户最相似的两个
topN_users = {}

for i in user_sim.index:
    df1 = user_sim.loc[i].drop(i)
    df1_sorted = df1.sort_values(ascending=False)
    top2 = list(df1_sorted.index[:2])
    topN_users[i] = top2
{'User1': ['User3', 'User2'], 'User2': ['User4', 'User1'], 'User3': ['User1', 'User5'], 'User4': ['User2', 'User5'], 'User5': ['User3', 'User4']}

推荐结果

# 根据topN的相似用户构建推荐结果
rs_results = {}

for user, sim_users in topN_users.items():
    rs_result = set()
    for sim_user in sim_users:
        # 获取物品共同购买过的集合
        rs_result |= set(df.loc[sim_user].replace(0, np.nan).dropna().index)

    # 过滤掉已经购买的商品
    rs_result -= set(df.loc[user].replace(0, np.nan).dropna().index)
    rs_results[user] = rs_result
{'User1': {'ItemE'}, 'User2': {'ItemB', 'ItemC'}, 'User3': {'ItemD', 'ItemB', 'ItemE'}, 'User4': {'ItemA', 'ItemC'}, 'User5': {'ItemD'}}

相关研究中,基于物品协同过滤系统的相似性度量方法普遍使用余弦相似性。 然而,在许多实际应用中,评价数据稀疏度过高,物品之间通过余弦相似度计算会产生误导性结果。 将杰卡德相似性度量应用到基于物品的协同过滤系统中,并建立起相应的评价分析方法。 与传统相似性度量方法相比,杰卡德方法完善了余弦相似性只考虑用户评分而忽略了其他信息量的弊端,特别适合于应用到稀疏度过高的数据

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值