文本的相似度 Sentence Similarity

最新推荐文章于 2024-08-21 09:11:03 发布

每天一个知识点

最新推荐文章于 2024-08-21 09:11:03 发布

阅读量829

点赞数

分类专栏： NLP 文章标签： NLP 余弦相似度

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_38166980/article/details/102692681

版权

本文介绍了两种文本相似度计算方法：欧式距离和余弦相似度。通过举例说明，展示了如何将文本转化为词频向量，并计算两文本之间的距离和相似度。然而，这种方法忽视了词的权重，对于关键词和通用词的重要性没有区分，为解决此问题，后续可以引入tf-idf技术。

摘要由CSDN通过智能技术生成

以下内容是通过学习b站“攻城狮之家”，写下的笔记。视频的老师讲的逻辑清晰容易理解，推荐给大家！

本文介绍两种计算文本相似的方法，一是计算距离（欧式距离），二是余弦相似度。

一、计算距离（欧式距离）

公式

d = |s1-s2| = √(x1-x2) ²+(y1-y2) ²

2.举例说明

S1 = “我们今天去爬山”

S2 = “你们昨天跑步”

S3 = “你们又去爬山又去跑步”

所有出现的词的集合为S，则S=[我们，今天，去，爬山，你们，昨天，跑步，又]

用向量表示S1,S2,S3，即在S中的词出现频率

S1 = （1,1,1,1,0,0,0,0）

S2 = （0,0,0,0,1,1,1,0）

S3 = （0,0,2,1,1,0,1,2）

d(S1,S2)=√(1²+1²

最低0.47元/天解锁文章

每天一个知识点

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。