ElasticSearch面试题整理（持续更新）_elsearch面试题，大数据开发插件化入门指南

2401_84159966

于 2024-04-13 06:04:39 发布

阅读量518

点赞数 14

分类专栏：程序员文章标签：大数据 elasticsearch 搜索引擎

本文链接：https://blog.csdn.net/2401_84159966/article/details/137703315

版权

程序员专栏收录该内容

30 篇文章 0 订阅

订阅专栏

Master节点负责管理集群状态信息，包括处理创建、删除索引等请求，决定分片被分配到哪个节点，维护和更新集群状态。值得注意的是，只有Master节点才能修改集群的状态信息，并负责同步给其他节点。

5. Elasticsearch更新和删除文档的过程

6. Elasticsearch创建索引文档的过程

7. 了解文本相似度 TF-IDF吗

TF = Term Frequency 词频，一个词在这个文档中出现的频率。值越大，说明这文档越匹配，
正向指标。
IDF = Inverse Document Frequency 反向文档频率，简单点说就是一个词在所有文档中都出
现，那么这个词不重要。

TF-IDF = TF / IDF

8. 了解ElasticSearch 深翻页的问题及解决吗？

深翻页：比如我们检索一次，轮询所有分片，汇集结果，根据 TF-IDF 等算法打分，排序后将前 10
条数据返回。用户感觉不错，说我看看下一页。ES 依然是轮询所有分片，汇集结果，根据 TF-IDF
等算法打分，排序后将前 11-20 条数据返回。
对用户来说，翻页应该很快啊，但是实际上，第一次检索多复杂，下一次检索就多复杂。
解决的话，可以把用户的检索结果，存入 Redis 中 10 分钟。这样分页就很快，超过 10 分钟，用户
不翻页，也就不会翻页了，数据就可以清除了。

9. 熟悉ElasticSearch 性能优化

批量提交
背景是大量的写操作，每次提交都是一次网络开销。网络永久是优化要考虑的重点。
优化硬盘
索引文件需要落地硬盘，段的思想又带来了更多的小文件，磁盘 IO 是 ES 的性能瓶颈。一个固态硬
盘比普通硬盘好太多。
减少副本数量
副本可以保证集群的可用性，但是严重影响了写索引的效率。写索引时不只完成写入索引，还要完成索引到副本的同步。ES 不是存储引擎，不要考虑数据丢失，性能更重要。如果是批量导入，建议就关闭副本。

10. ElasticSearch 查询优化手段有哪些？

设计阶段调优
（1）根据业务增量需求，采取基于日期模板创建索引，通过 roll over API 滚动索引；
（2）使用别名进行索引管理；
（3）每天凌晨定时对索引做 force_merge 操作，以释放空间；
（4）采取冷热分离机制，热数据存储到 SSD，提高检索效率；冷数据定期进行 shrink操作，以缩
减存储；
（5）采取 curator 进行索引的生命周期管理；
（6）仅针对需要分词的字段，合理的设置分词器；
（7）Mapping 阶段充分结合各个字段的属性，是否需要检索、是否需要存储等。………
写入调优

自我介绍一下，小编13年上海交大毕业，曾经在小公司待过，也去过华为、OPPO等大厂，18年进入阿里一直到现在。

深知大多数大数据工程师，想要提升技能，往往是自己摸索成长或者是报班学习，但对于培训机构动则几千的学费，着实压力不小。自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年大数据全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，基本涵盖了95%以上大数据开发知识点，真正体系化！

由于文件比较大，这里只是将部分目录大纲截图出来，每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频，并且后续会持续更新

如果你觉得这些内容对你有帮助，可以添加VX：vip204888 （备注大数据获取）

一个人可以走的很快，但一群人才能走的更远。不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎扫码加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

一群人才能走的更远。不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎扫码加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！**

2401_84159966

关注

14
点赞
踩
13

收藏

觉得还不错? 一键收藏
0
评论
ElasticSearch面试题整理（持续更新）_elsearch面试题，大数据开发插件化入门指南

Master节点负责管理集群状态信息，包括处理创建、删除索引等请求，决定分片被分配到哪个节点，维护和更新集群状态。一群人才能走的更远。深翻页：比如我们检索一次，轮询所有分片，汇集结果，根据 TF-IDF 等算法打分，排序后将前 10。（4）采取冷热分离机制，热数据存储到 SSD，提高检索效率；（1）根据业务增量需求，采取基于日期模板创建索引，通过 roll over API 滚动索引；对用户来说，翻页应该很快啊，但是实际上，第一次检索多复杂，下一次检索就多复杂。不翻页，也就不会翻页了，数据就可以清除了。
复制链接

扫一扫