ES零停机索引重建方案

1 说明
Elasticsearch是一个实时的分布式搜索引擎,为用户提供搜索服务,当我们决定存储某种数据时,在创
建索引的时候需要数据结构完整确定下来,与此同时索引的设定和很多固定配置将不能改变。当需要改
变数据结构时就需要重建索引。
2 解决方案
2.1 外部数据导入方案
2.1.1 整体介绍
系统架构设计中,有关系型数据库用来存储数据,Elasticsearch在系统架构里起到查询加速的作用,如果遇到索引重建的操作,待系统模块发布新版本后,可以从数据库将数据查询出来,重新灌到
Elasticsearch即可。
2.1.2 详细步骤
1. 通过MQ的web控制台或cli命令行,发送指定的MQ消息
2. MQ消息被微服务模块的消费者消费,触发ES数据重新导入功能
3. 微服务模块从数据库里查询数据的总数及批次信息,并将每个数据批次的分页信息重新发送给MQ 消息,分页信息包含查询条件和偏移量,此MQ消息还是会被微服务的MQ消息者接收处理
4. 微服务根据接收的查询条件和分页信息,从数据库获取到数据后,根据索引结构的定义,将数据组装成ES支持的JSON格式,并执行bulk命令,将数据发送给Elasticsearch集群。
2.1.3 方案缺点
1. 对数据库造成读取压力,短时间内大量的读操作,会占用数据库的硬件资源,严重时可能引起数据库性能下降。
2. 网络带宽占用多,数据毕竟是从一个库传到另一个库,虽说是内网,但大量的数据传输带宽占用也 需要注意。
3. 数据重建时间稍长,跟迁移的数据量大小有关。
2.2 基于scroll+bulk+索引别名方案
2.2.1 整体介绍
利用Elasticsearch自带的一些工具完成索引的重建工作,当然在方案实际落地时,可能也会依赖客户端的一些功能,比如用Java客户端持续的做scroll查询、bulk命令的封装等。数据完全自给自足,不依赖其他数据源
2.2.2 详细步骤
1. 若Java客户端没有使用别名,需要给客户端分配一个: PUT /book/_alias/book_alias
2. 新建索引book_new,将mapping信息,settings信息等按新的要求全部定义好。
3. 使用scroll api将数据批量查询出来为了使用 scroll,初始搜索请求应该在查询中指定 scroll 参数, 这可以告诉 Elasticsearch 需要保持搜索的上下文环境多久,1m 就是一分钟。
GET /book/_search?scroll=1m
{
“query”: {
“match_all”: {}
},
“sort”: [“_doc”],
“size”: 2 //每页两条数据
}
4. 采用bulk api将scoll查出来的一批数据,批量写入新索引
POST /_bulk
{ “index”: { “_index”: “book_new”, “_id”: “对应的id值” }}
{ 查询出来的数据值 }
5. 反复执行修改后的步骤3和步骤4,查询一批导入一批,以后可以借助Java Client或其他语言的API支持。注意做3时需要指定上一次查询的 scroll_id
6.切换别名book_alias到新的索引book_new上面,此时Java客户端仍然使用别名访问,也不需要修
改任何代码,不需要停机。
POST /_aliases
{
“actions”: [
{ “remove”: { “index”: “book”, “alias”: “book_alias” }},
{ “add”: { “index”: “book_new”, “alias”: “book_alias” }}
]
}
2.2.3 方案特点
在数据传输上基本自给自足,不依赖于其他数据源,Java客户端不需要停机等待数据迁移,网络传输占用带宽较小。只是scroll查询和bulk提交这部分,数据量大时需要依赖一些客户端工具。
2.3 Reindex API方案
2.3.1 详细步骤的基本命令
POST _reindex
{
“source”: {
“index”: “book”
},
“dest”: {
“index”: “book_new”
}
}
特别注意: 迁移前先把重建索引的映射创建好
2.3.2 version_type 属性
使用reindex api也是创建快照后再执行迁移的,这样目标索引的数据可能会与原索引有差异,
version_type属性可以决定乐观锁并发处理的规则
POST _reindex
{
“source”: {
“index”: “book”
},
“dest”: {
“index”: “book_new”,
“version_type”: “internal”
}
}
version_type属性含义如下:
internal:直接拷贝文档到目标索引,对相同的type、文档ID直接进行覆盖,默认值
external:迁移文档到目标索引时,保留version信息,对目标索引中不存在的文档进行创建,已
存在的文档按version进行更新,遵循乐观锁机制。
2.3.3 op_type 属性和conflicts 属性
如果op_type设置为create,那么迁移时只在目标索引中创建ID不存在的文档,已存在的文档,会提示
错误
POST _reindex
{
“source”: {
“index”: “book”
},
“dest”: {
“index”: “book_new”,
“op_type”: “create”
}
}
2.3.4 conflicts": “proceed"配置
如果加上"conflicts”: "proceed"配置项,那么冲突信息将不展示,只展示冲突的文档数量
POST _reindex
{
“conflicts”: “proceed”,
“source”: {
“index”: “book”
},
“dest”: {
“index”: “book_new”,
“op_type”: “create”
}
}
2.3.5 query支持
reindex api支持数据过滤、数据排序、size设置、_source选择等,也支持脚本执行
POST _reindex
{
“size”: 100,
“source”: {
“index”: “book”,
“query”: {
“term”: {
“language”: “english”
}
},
“sort”: {
“likes”: “desc”
}
},
“dest”: {
“index”: “book_new”
}
}

Elasticsearch是一个强大的全文搜索引擎,用于实时数据分析和存储。如果你需要重建索引,通常是由于以下原因: **如何重建索引:** 1. **登录Elasticsearch集群:** 使用Kibana、Logstash或直接通过命令行工具(如curl)连接到你的Elasticsearch节点。 2. **确定要重建索引:** 在`/_cat/indices` API中查找你要重置或重建索引名称。 3. **暂停索引:** 在索引命名空间运行`PUT /your_index_name/_settings`并设置`index.blocks.write = true`,以防新数据写入影响重建过程。 4. **删除旧索引:** 使用`DELETE /your_index_name`删除现有的索引,但要注意这将丢失所有未备份的数据。 5. **创建新的索引:** 发起一个新的索引请求,例如`PUT /your_new_index_name`。你可以指定新索引的配置选项,比如分片数、副本数等。 6. **重新映射数据:** 如果需要,可以在新的索引上运行`POST /_reindex`操作,将老索引中的文档迁移到新索引。如果不需要迁移,可以跳过此步骤。 7. **恢复索引状态:** 当数据迁移完成后,取消对旧索引的封锁,即执行`PUT /your_index_name/_settings`并设置`index.blocks.write = false`。 8. **验证重建:** 最后,检查新索引的状态是否正常,可以通过`GET /_cat/health`查看集群健康状况。 **相关问题--:** 1. 如何防止数据丢失在重建过程中? 2. 是否可以直接在现有索引重建而无需先删除? 3. 新建索引时如何处理字段类型变化导致的问题?
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值