31ES大合集

最新推荐文章于 2022-05-09 12:10:11 发布

Sigmund_Y

最新推荐文章于 2022-05-09 12:10:11 发布

阅读量938

点赞数

分类专栏： ES 文章标签： es

本文链接：https://blog.csdn.net/yangbllove/article/details/106042517

版权

1、es 读数据过程

可以通过 doc id 来查询，会根据 doc id 进行 hash，判断出来当时把 doc id 分配到了哪个 shard 上面去，从那个 shard 去查询。

客户端发送请求到任意一个 node，成为 coordinate node。
coordinate node 对 doc id 进行哈希路由，将请求转发到对应的 node，此时会使用 round-robin随机轮询算法，在 primary shard 以及其所有 replica 中随机选择一个，让读请求负载均衡。
接收请求的 node 返回 document 给 coordinate node。
coordinate node 返回 document 给客户端。

写请求是写入 primary shard，然后同步给所有的 replica shard；读请求可以从 primary shard 或 replica shard 读取，采用的是随机轮询算法

es写数据过程
1、客户端选择一个node发送请求过去，这个node就是coordinating node（协调节点）
2、coordinating node 对document进行路由，将请求转发给对应的node（有primary shard）
3、实际的node上的primary shard 处理请求，然后将数据同步到replica node。
4、coordinating node如果发现 primary node和所有replica node都搞定之后，就返回响应结果给客户端。

Lucene 把每次生成的倒排索引，叫做一个段(segment)。然后另外使用一个 commit 文件，记录索引内所有的 segment。而生成 segment 的数据来源，则是内存中的 buffer。
1、数据写入 --> 进入ES内存 buffer (同时记录到translog）–> 生成倒排索引分片（segment）
2、将 buffer 中的 segment 先同步到文件系统缓存中，然后再刷写到磁盘
我们把数据写到磁盘后,还要调用fsync才能把数据刷到磁盘中,如果不这样做在系统掉电的时候就会导致数据丢失,这个原理相信大家都清楚,elasticsearch为了高可靠性必须把所有的修改持久化到磁盘中。

elastic底层采用的是lucene这个库来实现倒排索引的功能,在lucene的概念里每一条记录称为document(文档),lucene使用segment(分段)来存储数据,用commit point来记录所有segment的元数据，一条记录要被搜索到,必须写入到segment中,这一点非常重要,后面会介绍为什么elastic搜索是near-realtime(接近实时的)而不是实时的。
elastic使用translog来记录所有的操作,我们称之为write-ahead-log，我们新增了一条记录时，es会把数据写到translog和in-memory buffer(内存缓存区)中,如下图所示:
在这里插入图片描述

分片
分片是一个底层的工作单元，一个分片是一个 Lucene 的实例，它本身就是一个完整的搜索引擎,文档不会跨分片存储。
索引与分片的关系图：
在这里插入图片描述
存储目录截图：

2、ES写数据底层原理

注意，客户端是可以在任意节点进行写入数据的，与Kakfa不同。
1）客户端选择一个node发送请求过去，这个node就是coordinating node（协调节点）
2）coordinating node，对document进行路由得到对应应该存储到哪个shard，将请求转发给对应的node（有prim