Elasticsearch-相关性算分:BM25算法【对TFIDF算法的优化;即:词频超过一定数量,超过的那部分不进行算分】【ES5.0之前默认的相关性算法是 TF-IDF,之后则默认采用BM25】

相关性算分:指文档与查询语句间的相关度,通过倒排索引可以获取与查询语句相匹配的文档列表

在这里插入图片描述
如何将最符合用户查询需求的文档放到前列呢?本质问题是一个排序的问题,排序的依据是相关性算分,确定倒排索引哪个文档排在前面

影响相关度算分的参数:
1、TF(Term Frequency):词频,即单词在文档中出现的次数,词频越高,相关度越高
2、Document Frequency(DF):文档词频,即单词出现的文档数
3、IDF(Inverse Document Frequency):逆向文档词频,与文档词频相反,即1/DF。即单词出现的文档数越少,相关度越高(如果一个单词在文档集出现越少,算为越重要单词)
4、Field-length Norm:文档越短,相关度越高

一、TF-IDF算法

在这里插入图片描述

二、BM25模型(5.X之后的默认模型)

对TF-IDF算法进行优化

在这里插入图片描述

BM25相比TF/IDF的一大优化是降低了tf在过大时的权重,避免词频对查询影响过大
在这里插入图片描述
总结一句话就是:BM25算法的优化,如果你单个词超过一定数量,这个词超过的那部分,将不进行算分!




参考资料:
ES系列13:彻底掌握相关度:从TF-IDF、BM25到对相关度的控制
es的相关性算分-BM25算法:词频超过一定数量,超过的那部分不进行算分

  • 1
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值