1. Elasticsearch的搜索类型（SearchType类型）

最新推荐文章于 2024-04-21 15:29:37 发布

静艺

最新推荐文章于 2024-04-21 15:29:37 发布

阅读量1.4k

点赞数 1

分类专栏： elasticsearch 文章标签： elasticsearch 搜索引擎 big data

本文链接：https://blog.csdn.net/wangzhiqiang123456/article/details/123070906

版权

elasticsearch 专栏收录该内容

12 篇文章 1 订阅

订阅专栏

分布式搜索背景介绍：
ES是一个分布式搜索引擎，分布式有分布式的缺点。比如要搜索某个单词，但是数据却分别在5个分片（Shard)上面，这5个分片可能在5台主机上面。因为全文搜索天生就要排序（按照匹配度进行排名）,但数据却在5个分片上，如何得到最后正确的排序呢？ES是这样做的，大概分两步。

第一步： ES客户端会将这个搜索词同时向5个分片发起搜索请求，这叫Scatter,
第二部：这5个分片基于本Shard独立完成搜索，然后将符合条件的结果全部返回，这一步叫Gather。
客户端将返回的结果进行重新排序和排名，最后返回给用户。也就是说，ES的一次搜索，是一次scatter/gather过程（这个跟mapreduce也很类似）.

然而这其中有两个问题:
第一、数量问题。比如，用户需要搜索”双黄连”，要求返回最符合条件的前10条。但在5个分片中，可能都存储着双黄连相关的数据。所以ES会向这5个分片都发出查询请求，并且要求每个分片都返回符合条件的10条记录。当ES得到返回的结果后，进行整体排序，然后取最符合条件的前10条返给用户。这种情况，ES5个shard最多会收到10*5=50条记录，这样返回给用户的结果数量会多于用户请求的数量。

第二、排名问题。上面搜索，每个分片计算分值都是基于自己的分片数据进行计算的。计算分值使用的词频率和其他信息都是基于自己的分片进行的，而ES进行整体排名是基于每个分片计算后的分值进行排序的，这就可能会导致排名不准确的问题。如果我们想更精确的控制排序，应该先将计算排序和排名相关的信息（词频率等）从5个分片收集上来，进行统一计算，然后使用整体的词频率去每个分片进行查询。

这两个问题，估计ES也没有什么较好的解决方法，最终把选择的权利交给用户，方法就是在搜索的时候指定query type。

es在查询时，可以指定搜索类型为：
query_then_fetch、query_and_featch、dfs_query_then_featch和dfs_query_and_featch

1、 query_and_featch

　　向索引的所有分片（ shard）都发出查询请求，各分片返回的时候把元素文档（ document）和计算后的排名信息一起返回。

　　这种搜索方式是最快的。因为相比下面的几种搜索方式，这种查询方法只需要去 shard查询一次。但是各个 shard 返回的结果的数量之和可能是用户要求的 size 的 n 倍。

　　优点：这种搜索方式是最快的。因为相比后面的几种es的搜索方式，这种查询方法只需要去shard查询一次。

　　缺点：返回的数据量不准确，可能返回(N*分片数量)的数据并且数据排名也不准确，同时各个shard返回的结果的数量之和可能是用户要求的size的n倍。

2、 query_then_fetch（ es 默认的搜索方式）

　　如果你搜索时，没有指定搜索方式，就是使用的这种搜索方式。这种搜索方式，大概分两个步骤：

　　第一步，先向所有的 shard 发出请求，各分片只返回文档 id(注意，不包括文档 document)和排名相关的信息(也就是文档对应的分值)，然后按照各分片返回的文档的分数进行重新排序和排名，取前 size 个文档。

　　第二步，根据文档 id 去相关的 shard 取 document。这种方式返回的 document 数量与用户要求的大小是相等的。

　　优点：

　　　　返回的数据量是准确的。

　　缺点：

　　　　性能一般，并且数据排名不准确。

3、 dfs_query_and_featch

　　这种方式比第一种方式多了一个 DFS 步骤，有这一步，可以更精确控制搜索打分和排名。也就是在进行查询之前，先对所有分片发送请求，把所有分片中的词频和文档频率等打分依据全部汇总到一块，再执行后面的操作、

　　优点：

　　　　数据排名准确

　　缺点：

　　　　性能一般

　　　　返回的数据量不准确，可能返回(N*分片数量)的数据

4、 dfs_query_then_featch

　　比第 2 种方式多了一个 DFS 步骤。

　　也就是在进行查询之前，先对所有分片发送请求，把所有分片中的词频和文档频率等打分依据全部汇总到一块，再执行后面的操作、

　　优点：

　　　　返回的数据量是准确的

　　　　数据排名准确

　　缺点：

　　　　性能最差【这个最差只是表示在这四种查询方式中性能最慢，也不至于不能忍受，如果对查询性能要求不是非常高，而对查询准确度要求比较高的时候可以考虑这个】

DFS 是一个什么样的过程？

　　从 es 的官方网站我们可以发现， dfs 其实就是在进行真正的查询之前，先把各个分片的词频率和文档频率收集一下，然后进行词搜索的时候，各分片依据全局的词频率和文档频率进行搜索和排名。显然如果使用 dfs_query_then_fetch 这种查询方式，效率是最低的，因为一个搜索，可能要请求 3 次分片。但，使用 dfs 方法，搜索精度是最高的。

　　总结一下，从性能考虑 query_and_fetch 是最快的， dfs_query_then_fetch 是最慢的。从搜索的准确度来说， dfs 要比非 dfs 的准确度更高。

如何指定：

sg_self_customer_monitor_trend_2_index/_search?search_type=query_then_fetch

静艺

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
1. Elasticsearch的搜索类型（SearchType类型）

分布式搜索背景介绍：ES是一个分布式搜索引擎，分布式有分布式的缺点。比如要搜索某个单词，但是数据却分别在5个分片（Shard)上面，这5个分片可能在5台主机上面。因为全文搜索天生就要排序（按照匹配度进行排名）,但数据却在5个分片上，如何得到最后正确的排序呢？ES是这样做的，大概分两步。第一步： ES客户端会将这个搜索词同时向5个分片发起搜索请求，这叫Scatter,第二部：这5个分片基于本Shard独立完成搜索，然后将符合条件的结果全部返回，这一步叫Gather。客户端将返回的结果进行重新排序和
复制链接

扫一扫