python用角度计算余弦值_余弦相似性计算及python代码实现过程解析

A:西米喜欢健身

B:超超不爱健身,喜欢打游戏

step1:分词

A:西米/喜欢/健身

B:超超/不/喜欢/健身,喜欢/打/游戏

step2:列出两个句子的并集

西米/喜欢/健身/超超/不/打/游戏

step3:计算词频向量

A:[1,1,1,0,0,0,0]

B:[0,1,1,1,1,1,1]

step4:计算余弦值

余弦值越大,证明夹角越小,两个向量越相似。

step5:python代码实现

import jieba

import jieba.analyse

def words2vec(words1=None, words2=None):

v1 = []

v2 = []

tag1 = jieba.analyse.extract_tags(words1, withWeight=True)

tag2 = jieba.analyse.extract_tags(words2, withWeight=True)

tag_dict1 = {i[0]: i[1] for i in tag1}

tag_dict2 = {i[0]: i[1] for i in tag2}

merged_tag = set(tag_dict1.keys()) | set(tag_dict2.keys())

for i in merged_tag:

if i in tag_dict1:

v1.append(tag_dict1[i])

else:

v1.append(0)

if i in tag_dict2:

v2.append(tag_dict2[i])

else:

v2.append(0)

return v1, v2

def cosine_similarity(vector1, vector2):

dot_product = 0.0

normA = 0.0

normB = 0.0

for a, b in zip(vector1, vector2):

dot_product += a * b

normA += a ** 2

normB += b ** 2

if normA == 0.0 or normB == 0.0:

return 0

else:

return round(dot_product / ((normA**0.5)*(normB**0.5)) * 100, 2)

def cosine(str1, str2):

vec1, vec2 = words2vec(str1, str2)

return cosine_similarity(vec1, vec2)

print(cosine('阿克苏苹果', '阿克苏苹果'))

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持我们。

本文标题: 余弦相似性计算及python代码实现过程解析

本文地址: http://www.cppcns.com/jiaoben/python/274843.html

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值